O BMW Group passou a detectar anomalias de custo de forma automática e diária em seu ambiente de nuvem, que reúne mais de 14 mil contas. O caso foi detalhado em 21 de setembro de 2026 no blog de aprendizado de máquina da AWS, em artigo assinado por Philipp Karg, do BMW Group, e Christopher Masurek, da Data Reply.
A montadora alemã opera o CLEA (Cloud Efficiency Analytics), plataforma interna de FinOps construída sobre a AWS em parceria com a Reply. Agora envia alertas por e-mail aos responsáveis por cada conta quando o gasto foge do padrão esperado.
Do painel ao alerta proativo
O CLEA começou como um conjunto de painéis no Amazon QuickSight. Eles davam aos funcionários do grupo visibilidade sobre o consumo de nuvem.
A limitação apontada pelos autores é direta. Um painel mostra o que já aconteceu, e apenas quando alguém decide abri-lo.
Para fechar essa lacuna entre visibilidade e ação, a plataforma passou a executar a detecção de anomalias todos os dias. Também dispara e-mails automáticos aos donos das contas.
A proposta é substituir a leitura reativa de relatórios por avisos proativos.
A previsão por trás do alerta
A matéria-prima do sistema é o faturamento. O CLEA ingere diariamente os AWS Cost and Usage Reports, a fonte primária, além das exportações equivalentes dos outros provedores de nuvem usados pelo grupo.
O volume bruto é de aproximadamente 3 bilhões de linhas distribuídas em 500 colunas por mês. Elas são agregadas a um único grão: custo diário por conta por serviço.
Os dados chegam com um dia de atraso (T-1). O pipeline só roda depois que a entrega do CUR é confirmada como completa, para não analisar dias parciais.
Cada par conta-serviço vira uma série temporal independente. Uma conta que usa Amazon EC2, Amazon S3, AWS Lambda e Amazon RDS gera quatro séries diárias.
Uma conta com 15 serviços gera 15. Somando as 14 mil contas, com seus diferentes conjuntos de serviços ativos, chega-se a centenas de milhares de combinações.
Cada uma exige previsão própria e avaliação própria de anomalia.
Para prever, o CLEA recorre ao Prophet, biblioteca de código aberto da Meta. A escolha se deu pela simplicidade e pelo desempenho estável em séries de custo. O modelo treina com 365 dias de histórico diário para cada par conta-serviço, com sazonalidade aditiva.
Três termos organizam o restante do raciocínio. Gasto esperado é o custo previsto para um par conta-serviço em um dia.
Gasto real é o valor registrado no faturamento. Impacto é a diferença entre os dois, de modo que impacto positivo indica gasto acima da previsão.
Pipeline serverless e custo
O AWS Step Functions orquestra a execução diária. Uma função Lambda de preparação descobre quais contas estão ativas e grava a lista em JSON no Amazon S3.
Em seguida, um Distributed Map distribui o trabalho por até 500 funções Lambda simultâneas. Cada uma prevê os serviços de uma conta, e a rodada completa das 14 mil contas termina em cerca de 20 minutos.
A saída tem dois usos: uma previsão móvel de 12 meses e os valores diários previstos, que se tornam a linha de base para a detecção.
Os autores descrevem a previsão como um módulo plugável. As interfaces são o formato de entrada (custo diário por conta-serviço) e o de saída (valores previstos por dia, com intervalos de confiança).
Isso permite trocar o motor de previsão sem mexer nas camadas de detecção e alerta das quais os donos de contas dependem todos os dias. Todo esse processamento diário custa cerca de US$ 50 por mês em computação.
Por que uma regra fixa não resolve
Uma regra simples, como alertar sempre que o gasto diário ultrapassa determinado valor em dólares, não se sustenta nessa escala. Contas crescem, adotam novos serviços e sobem cargas de trabalho de propósito.
Uma regra fixa lê tudo isso como anomalia.
Se o limite for alto o bastante para não incomodar as maiores contas, as menores ficam sem cobertura alguma. Por isso o CLEA aprende a trajetória de cada par conta-serviço.
Compara o gasto com o comportamento real daquela série, e não com um número escolhido centralmente.
O preço dessa escolha é conhecido. Um modelo que se adapta a tendências acaba absorvendo uma delas.
Um salto sustentado de gasto é sinalizado nos primeiros dias e depois se acomoda como novo patamar esperado, à medida que a janela de treino se atualiza. A detecção, portanto, é mais forte em picos do que em mudanças graduais de nível.







