BMW detecta anomalias de custo em 14 mil contas de nuvem com IA

BMW detecta anomalias de custo em 14 mil contas de nuvem com IA

O BMW Group passou a detectar anomalias de custo de forma automática e diária em seu ambiente de nuvem, que reúne mais de 14 mil contas. O caso foi detalhado em 21 de setembro de 2026 no blog de aprendizado de máquina da AWS, em artigo assinado por Philipp Karg, do BMW Group, e Christopher Masurek, da Data Reply.

A montadora alemã opera o CLEA (Cloud Efficiency Analytics), plataforma interna de FinOps construída sobre a AWS em parceria com a Reply. Agora envia alertas por e-mail aos responsáveis por cada conta quando o gasto foge do padrão esperado.

Do painel ao alerta proativo

O CLEA começou como um conjunto de painéis no Amazon QuickSight. Eles davam aos funcionários do grupo visibilidade sobre o consumo de nuvem.

A limitação apontada pelos autores é direta. Um painel mostra o que já aconteceu, e apenas quando alguém decide abri-lo.

Para fechar essa lacuna entre visibilidade e ação, a plataforma passou a executar a detecção de anomalias todos os dias. Também dispara e-mails automáticos aos donos das contas.

A proposta é substituir a leitura reativa de relatórios por avisos proativos.

A previsão por trás do alerta

A matéria-prima do sistema é o faturamento. O CLEA ingere diariamente os AWS Cost and Usage Reports, a fonte primária, além das exportações equivalentes dos outros provedores de nuvem usados pelo grupo.

O volume bruto é de aproximadamente 3 bilhões de linhas distribuídas em 500 colunas por mês. Elas são agregadas a um único grão: custo diário por conta por serviço.

Os dados chegam com um dia de atraso (T-1). O pipeline só roda depois que a entrega do CUR é confirmada como completa, para não analisar dias parciais.

Cada par conta-serviço vira uma série temporal independente. Uma conta que usa Amazon EC2, Amazon S3, AWS Lambda e Amazon RDS gera quatro séries diárias.

Uma conta com 15 serviços gera 15. Somando as 14 mil contas, com seus diferentes conjuntos de serviços ativos, chega-se a centenas de milhares de combinações.

Cada uma exige previsão própria e avaliação própria de anomalia.

Para prever, o CLEA recorre ao Prophet, biblioteca de código aberto da Meta. A escolha se deu pela simplicidade e pelo desempenho estável em séries de custo. O modelo treina com 365 dias de histórico diário para cada par conta-serviço, com sazonalidade aditiva.

Três termos organizam o restante do raciocínio. Gasto esperado é o custo previsto para um par conta-serviço em um dia.

Gasto real é o valor registrado no faturamento. Impacto é a diferença entre os dois, de modo que impacto positivo indica gasto acima da previsão.

Pipeline serverless e custo

O AWS Step Functions orquestra a execução diária. Uma função Lambda de preparação descobre quais contas estão ativas e grava a lista em JSON no Amazon S3.

Em seguida, um Distributed Map distribui o trabalho por até 500 funções Lambda simultâneas. Cada uma prevê os serviços de uma conta, e a rodada completa das 14 mil contas termina em cerca de 20 minutos.

A saída tem dois usos: uma previsão móvel de 12 meses e os valores diários previstos, que se tornam a linha de base para a detecção.

Os autores descrevem a previsão como um módulo plugável. As interfaces são o formato de entrada (custo diário por conta-serviço) e o de saída (valores previstos por dia, com intervalos de confiança).

Isso permite trocar o motor de previsão sem mexer nas camadas de detecção e alerta das quais os donos de contas dependem todos os dias. Todo esse processamento diário custa cerca de US$ 50 por mês em computação.

Por que uma regra fixa não resolve

Uma regra simples, como alertar sempre que o gasto diário ultrapassa determinado valor em dólares, não se sustenta nessa escala. Contas crescem, adotam novos serviços e sobem cargas de trabalho de propósito.

Uma regra fixa lê tudo isso como anomalia.

Se o limite for alto o bastante para não incomodar as maiores contas, as menores ficam sem cobertura alguma. Por isso o CLEA aprende a trajetória de cada par conta-serviço.

Compara o gasto com o comportamento real daquela série, e não com um número escolhido centralmente.

O preço dessa escolha é conhecido. Um modelo que se adapta a tendências acaba absorvendo uma delas.

Um salto sustentado de gasto é sinalizado nos primeiros dias e depois se acomoda como novo patamar esperado, à medida que a janela de treino se atualiza. A detecção, portanto, é mais forte em picos do que em mudanças graduais de nível.

Fontes e links

Matéria publicada originalmente em AWS

Últimas Notícias

NVIDIA apresenta Halos, segurança full-stack para IA física
EXL usa IA na AWS para cortar revisão de sinistros médicos
Benchling isola código de agentes de IA na AWS com DNS Firewall
Disrupt 2026: desconto de até US$ 200 acaba em 25 de setembro