Um relato publicado pela AWS em 1º de outubro de 2026 detalha como o Amazon Payments aplicou personalização baseada em inteligência artificial a um funil de aquisição de produto. A solução usa um bandit multi-braços (multi-armed bandit, MAB) contextual e multiobjetivo no Amazon SageMaker AI.
Em um teste A/B online com duração de sete semanas, a equipe registrou um ganho relativo de conversão de um dígito alto na etapa final do funil para uma população de clientes. Uma segunda população, porém, não apresentou melhora em relação à experiência existente.
O diagnóstico dos responsáveis pelo projeto foi direto: a restrição estava no conteúdo, não no modelo.
Da produção à seleção de conteúdo
Nos últimos anos, a IA generativa tornou barato produzir conteúdo personalizado em grande volume. Em um post anterior, a AWS mostrou como modelos no Amazon Bedrock podem gerar material personalizado em escala, respeitando diretrizes de marca e guardrails.
Com isso, o desafio deixou de ser criar variações e passou a ser escolher: entre todas as opções disponíveis, qual delas mostrar para cada cliente e quanto tempo leva para aprender qual funciona melhor. É esse problema de seleção que o novo relato aborda.
Como funcionam os bandits multi-braços
Um bandit multi-braços é um método de aprendizado por reforço criado para cenários com muitas opções e tráfego limitado. Cada variação de conteúdo é tratada como um "braço": o sistema testa as alternativas contra o tráfego real e desloca gradualmente as impressões para as que apresentam melhor desempenho, mantendo uma fração reservada para continuar testando as demais.
O mecanismo equilibra dois objetivos permanentes, a exploração da melhor opção conhecida e a experimentação de alternativas menos certas em busca de evidência. Como as duas coisas acontecem ao mesmo tempo, o sistema segue aprendendo conforme novas variações entram e não precisa esperar o encerramento de um teste.
A literatura descreve várias estratégias de seleção, como epsilon-greedy, Upper Confidence Bound (UCB) e Thompson sampling; a AWS já publicou um material sobre testes A/B dinâmicos com projetos de MLOps do SageMaker.
UCB, contexto e linucb
No Amazon Payments, a escolha recaiu sobre o UCB, estratégia que seleciona o braço com a maior recompensa estimada somada a um bônus de incerteza. A regra determinística foi um fator relevante: ela gera decisões auditáveis e reproduzíveis para cada impressão, algo sensível em um contexto de pagamentos.
O passo seguinte foi adicionar contexto. Um bandit padrão aprende um único braço ótimo para toda a audiência; bandits segmentados rodam uma instância por grupo definido manualmente, mas os grupos são arbitrários e cada um precisa de tráfego próprio.
Já o bandit contextual condiciona a decisão a um vetor de atributos, o que permite que um padrão aprendido em um contexto se transfira para visitas semelhantes.
Na produção, cada cliente é representado por um vetor de sinais comportamentais, como comportamento de pagamento e composição de transações, no lugar de um segmento fixo. O identificador da entidade, uma chave opaca como entity_id, serve apenas para encaminhar a recomendação aprendida de volta ao visitante certo e nunca é usado como entrada do modelo.
Para o aprendizado em nível de atributo, a equipe escolheu o Linear UCB (LinUCB), apresentado por Li et al. em 2010. O método parte da premissa de que a recompensa esperada de um braço é uma função linear do vetor de contexto, o que possibilita generalizar padrões para visitantes ainda não observados.
Apesar de existirem algoritmos mais recentes, o LinUCB foi mantido por ser computacionalmente eficiente, auditável, com seleção determinística de braço, e capaz de lidar com um espaço grande de braços a partir de poucos dados iniciais.
O que o teste de sete semanas mostrou
Os números divulgados vêm de um teste A/B online de sete semanas: ganho relativo de conversão de um dígito alto no fim do funil para uma das populações de clientes e nenhuma melhoria para a outra. O resultado assimétrico levou a equipe a concluir que a limitação estava no conteúdo oferecido, e não na capacidade do modelo de selecionar a melhor opção.
Para quem quiser reproduzir o caminho, a AWS disponibilizou um repositório de código que permite testar a abordagem com dados sintéticos e entender o método na prática usando o Amazon SageMaker AI.
Por que isso importa
Conforme a IA generativa multiplica o volume de variações disponíveis, a seleção tende a se tornar o principal gargalo de programas de personalização. Bandits oferecem uma alternativa aos testes A/B/n tradicionais em cenários de tráfego limitado, porque aprendem continuamente sem interromper o atendimento.
Em setores regulados, a exigência de decisões reproduzíveis favorece estratégias determinísticas como o UCB. A adoção de vetores de contexto no lugar de segmentos definidos à mão também reduz a dependência de agrupamentos arbitrários e do tráfego dedicado que cada grupo exigiria.
O caso do Amazon Payments acrescenta um limite prático: nenhum algoritmo compensa um catálogo de conteúdo que não conversa com o público.
Fontes e links
- AWS
- Repositório de código: multi-objective contextual bandit com SageMaker
- Paper do LinUCB, de Li et al. (2010)
- Post anterior sobre personalização com IA generativa no Amazon Bedrock







