Amazon Payments eleva conversão com bandits contextuais na AWS

Amazon Payments eleva conversão com bandits contextuais na AWS

Um relato publicado pela AWS em 1º de outubro de 2026 detalha como o Amazon Payments aplicou personalização baseada em inteligência artificial a um funil de aquisição de produto. A solução usa um bandit multi-braços (multi-armed bandit, MAB) contextual e multiobjetivo no Amazon SageMaker AI.

Em um teste A/B online com duração de sete semanas, a equipe registrou um ganho relativo de conversão de um dígito alto na etapa final do funil para uma população de clientes. Uma segunda população, porém, não apresentou melhora em relação à experiência existente.

O diagnóstico dos responsáveis pelo projeto foi direto: a restrição estava no conteúdo, não no modelo.

Da produção à seleção de conteúdo

Nos últimos anos, a IA generativa tornou barato produzir conteúdo personalizado em grande volume. Em um post anterior, a AWS mostrou como modelos no Amazon Bedrock podem gerar material personalizado em escala, respeitando diretrizes de marca e guardrails.

Com isso, o desafio deixou de ser criar variações e passou a ser escolher: entre todas as opções disponíveis, qual delas mostrar para cada cliente e quanto tempo leva para aprender qual funciona melhor. É esse problema de seleção que o novo relato aborda.

Como funcionam os bandits multi-braços

Um bandit multi-braços é um método de aprendizado por reforço criado para cenários com muitas opções e tráfego limitado. Cada variação de conteúdo é tratada como um "braço": o sistema testa as alternativas contra o tráfego real e desloca gradualmente as impressões para as que apresentam melhor desempenho, mantendo uma fração reservada para continuar testando as demais.

O mecanismo equilibra dois objetivos permanentes, a exploração da melhor opção conhecida e a experimentação de alternativas menos certas em busca de evidência. Como as duas coisas acontecem ao mesmo tempo, o sistema segue aprendendo conforme novas variações entram e não precisa esperar o encerramento de um teste.

A literatura descreve várias estratégias de seleção, como epsilon-greedy, Upper Confidence Bound (UCB) e Thompson sampling; a AWS já publicou um material sobre testes A/B dinâmicos com projetos de MLOps do SageMaker.

UCB, contexto e linucb

No Amazon Payments, a escolha recaiu sobre o UCB, estratégia que seleciona o braço com a maior recompensa estimada somada a um bônus de incerteza. A regra determinística foi um fator relevante: ela gera decisões auditáveis e reproduzíveis para cada impressão, algo sensível em um contexto de pagamentos.

O passo seguinte foi adicionar contexto. Um bandit padrão aprende um único braço ótimo para toda a audiência; bandits segmentados rodam uma instância por grupo definido manualmente, mas os grupos são arbitrários e cada um precisa de tráfego próprio.

Já o bandit contextual condiciona a decisão a um vetor de atributos, o que permite que um padrão aprendido em um contexto se transfira para visitas semelhantes.

Na produção, cada cliente é representado por um vetor de sinais comportamentais, como comportamento de pagamento e composição de transações, no lugar de um segmento fixo. O identificador da entidade, uma chave opaca como entity_id, serve apenas para encaminhar a recomendação aprendida de volta ao visitante certo e nunca é usado como entrada do modelo.

Para o aprendizado em nível de atributo, a equipe escolheu o Linear UCB (LinUCB), apresentado por Li et al. em 2010. O método parte da premissa de que a recompensa esperada de um braço é uma função linear do vetor de contexto, o que possibilita generalizar padrões para visitantes ainda não observados.

Apesar de existirem algoritmos mais recentes, o LinUCB foi mantido por ser computacionalmente eficiente, auditável, com seleção determinística de braço, e capaz de lidar com um espaço grande de braços a partir de poucos dados iniciais.

O que o teste de sete semanas mostrou

Os números divulgados vêm de um teste A/B online de sete semanas: ganho relativo de conversão de um dígito alto no fim do funil para uma das populações de clientes e nenhuma melhoria para a outra. O resultado assimétrico levou a equipe a concluir que a limitação estava no conteúdo oferecido, e não na capacidade do modelo de selecionar a melhor opção.

Para quem quiser reproduzir o caminho, a AWS disponibilizou um repositório de código que permite testar a abordagem com dados sintéticos e entender o método na prática usando o Amazon SageMaker AI.

Por que isso importa

Conforme a IA generativa multiplica o volume de variações disponíveis, a seleção tende a se tornar o principal gargalo de programas de personalização. Bandits oferecem uma alternativa aos testes A/B/n tradicionais em cenários de tráfego limitado, porque aprendem continuamente sem interromper o atendimento.

Em setores regulados, a exigência de decisões reproduzíveis favorece estratégias determinísticas como o UCB. A adoção de vetores de contexto no lugar de segmentos definidos à mão também reduz a dependência de agrupamentos arbitrários e do tráfego dedicado que cada grupo exigiria.

O caso do Amazon Payments acrescenta um limite prático: nenhum algoritmo compensa um catálogo de conteúdo que não conversa com o público.

Fontes e links

Matéria publicada originalmente em AWS

Últimas Notícias

DistroKid tira músicas do ar após processo da UMG sobre IA
Apple contrata equipe da Huxe e licencia tecnologia de podcasts
Agentes de IA que vivem no seu SMS: a nova disputa do setor
Agentes da Anthropic enviam 20 pedidos de visto a site dos EUA