A AWS publicou em 11 de setembro de 2026, em seu blog de machine learning, uma análise que propõe abandonar a métrica de dólares por milhão de tokens como critério central na escolha de modelos de IA generativa. O material apresenta um harness de benchmarking de código aberto que mede custo por resposta correta, custo de trajetórias de agentes e qualidade de entregáveis profissionais avaliada por rubricas. O estudo compara três modelos OpenAI disponíveis no Amazon Bedrock — gpt-5.6-luna, gpt-5.6-terra e gpt-5.6-sol — com dois modelos econômicos amplamente usados como linha de base na API da OpenAI: gpt-5.4-mini e gpt-5.4-nano.
O que o harness mede
A premissa é simples: workloads de produção não compram tokens, compram resultados — um ticket de suporte resolvido, um resumo financeiro correto, um relatório concluído. Entre o preço de tabela e o resultado final existem multiplicadores que a etiqueta ignora: a frequência com que o modelo acerta, quantos tokens ele consome para chegar lá e, em cargas agênticas, quantos turnos são necessários, já que cada turno reenvia a conversa acumulada.
O harness, disponível no repositório openai-on-aws/benchmarks-openai, executa um único caminho de código — a OpenAI Responses API — contra as duas aplicações, trocando apenas o backend e o ID do modelo, mantendo a lógica de avaliação constante. Cada execução grava um arquivo JSON com carimbo de tempo, e todos os números e gráficos do post são gerados a partir desses arquivos.
O custo de uma resposta correta
A avaliação usa três benchmarks que ainda separam modelos de fronteira: AIME (matemática de competição), GPQA Diamond (ciência de nível de pós-graduação) e MMLU-Pro. Para cada um, o custo total gasto pelo modelo — incluindo tentativas erradas — é dividido pelo número de respostas corretas.
Os resultados mostram degraus claros de capacidade. O gpt-5.6-sol resolve 75% dos problemas de AIME, contra 37% do gpt-5.4-mini, e lidera também no GPQA Diamond (68% contra 43%) e no MMLU-Pro (82% contra 59%). O texto observa que, se as tentativas fossem independentes e a acurácia constante, 37% de acerto implicaria cerca de 2,7 tentativas por sucesso — mas ressalta que retentativas reais são correlacionadas, e que a estratégia de retry de cada equipe deve ser medida, não estimada.
Eficiência de tokens e mudança de preço
Segundo a análise, a eficiência de tokens decidiu a fatura antes mesmo de os preços se moverem. No preço de lista original, cerca de 1,5 vez o do mini, o gpt-5.6-luna já era 25% mais barato por resposta correta de AIME na configuração testada, porque rodava com raciocínio desativado e consumia menos tokens cobrados do que o mini em seus padrões. Depois, veio a redução de preços de GPT-5.6 Luna e Terra no Amazon Bedrock, anunciada em 30 de julho de 2026, que alterou novamente a comparação.
Agentes e entregáveis profissionais
Além de perguntas isoladas, o harness mede trajetórias multi-turno em tarefas de pesquisa na web ao vivo — cenário em que a contagem de turnos pode dominar a conta — e entregáveis ocupacionais reais, avaliados por rubricas. A correção combina verificações determinísticas com um juiz baseado em LLM (gpt-5.5, que não está entre os modelos avaliados), usando prompts congelados cujos hashes ficam registrados em cada arquivo de resultado.
Ressalvas metodológicas
O próprio texto faz questão de delimitar o alcance das conclusões. Os modelos rodando no Amazon Bedrock foram executados com raciocínio desativado, enquanto as linhas de base na API da OpenAI operaram em seus padrões. Trata-se, portanto, de uma comparação entre configurações práticas de implantação, e não de uma estimativa controlada de capacidade intrínseca. Os tamanhos de amostra variam de 48 a 198 itens, e diferenças pequenas devem ser lidas como direcionais, a menos que venham acompanhadas de estimativas de incerteza. A recomendação explícita é reproduzir a avaliação na própria carga de trabalho antes de escolher um modelo.
Por que isso importa
A discussão chega em um momento em que equipes brasileiras escalam aplicações de IA generativa e precisam justificar orçamento. Trocar a pergunta "quanto custa o token?" por "quanto custa acertar?" muda a matemática de seleção de modelos, favorece modelos com raciocínio desativado em tarefas simples e expõe o peso real dos loops agênticos. Como o harness é aberto e roda sobre a mesma API de respostas, a decisão deixa de depender de benchmarks genéricos e passa a ser testável com os dados e as tarefas de cada organização.
Fontes e links
- AWS
- Repositório do harness de benchmarking (openai-on-aws/benchmarks-openai)
- Anúncio de redução de preços de GPT-5.6 Luna e Terra no Amazon Bedrock







