Para um agente de atendimento, a tarefa parecia encerrada. O eletrodoméstico de US$ 745 de uma cliente estava parado em uma "exceção" da transportadora em um centro de distribuição em Nashville, quinze dias depois da data estimada de entrega.
O agente fez nove chamadas de ferramenta: puxou o pedido, verificou o rastreamento, consultou o perfil da cliente, leu a política de reembolso duas vezes, confirmou que não havia ticket aberto, criou um, documentou a linha do tempo e concluiu, corretamente, que o segmento daquela conta não dava direito a compensação por atraso. Em seguida, marcou o ticket como "resolved" e perguntou se podia ajudar em algo mais.
Duas coisas estavam erradas. A exceção da transportadora continuava aberta, de modo que o estado final exigido era "on hold", à espera de resolução — e a cliente nunca recebeu resposta de verdade para o que perguntou.
Um avaliador automático que olhasse apenas as chamadas de ferramenta veria nove chamadas bem formadas. O banco de dados discordou.
Esse é o intervalo que o ThinkingBox, benchmark apresentado pela Microsoft e pela Hugging Face em 3 de outubro de 2026, se propõe a medir, conforme o artigo conjunto publicado no blog da Hugging Face.
O banco de dados discorda
O caso acima é adaptado de uma tarefa real do benchmark, identificada como sandbox_external_retail_group1.py:test_case_ST003_006, disponível no repositório de dados do projeto. A verificação executável que falha é um único campo: o status do ticket ficou como "solved" quando o estado final obrigatório era "hold".
O trace completo aparece no Apêndice D.4, Caso 3, do paper assinado pelos pesquisadores. A lição é direta: respostas finais e chamadas de ferramenta válidas são apenas proxies.
Um agente pode soar correto e, ainda assim, gravar o valor errado, alterar o registro errado ou criar um efeito colateral a mais. Só os registros que ele deixa para trás resolvem a questão.
O que dizem os números
O problema não é pequeno. Em uma ablação de conjunto comum que reuniu 121.680 tentativas válidas distribuídas entre 12 modelos de LLM, 79.853 tentativas falharam nas verificações executáveis.
Desse total de falhas, 67,24% terminaram de forma limpa e invocaram uma ferramenta capaz de alterar estado, ou seja, o desfecho foi silencioso para quem apenas acompanhava a conversa. O benchmark cobre 507 fluxos de trabalho de negócios com estado, e cada um deles é executado 20 vezes contra diferentes modelos.
A repetição é o ponto central da proposta: um acerto isolado não é confiabilidade. A pergunta que o ThinkingBox faz é se o mesmo agente consegue produzir o resultado correto vinte vezes seguidas, o que separa demonstrações impressionantes de sistemas realmente confiáveis.
Como o benchmark funciona
O ThinkingBox executa um agente contra sess ões isoladas de ferramentas MCP e, depois, avalia o estado terminal do backend e os efeitos colaterais deixados pela execução, não a prosa do relatório final. A infraestrutura está disponível por meio do OpenEnv, o que permite rodar o benchmark por conta própria.
Os resultados detalhados, incluindo o custo da consistência e as assinaturas de falha observadas nos diferentes modelos, estão no paper publicado no arXiv. O post é assinado por Tuhin Kundu e pela Microsoft, com agradecimentos a Tommy Guy, fundador da Enderis AI e ex-Microsoft, a Sergio Paniego, da Hugging Face, e aos ex-estagiários Zhuochun Li (University of Pittsburgh), Ali Keramati (UC Irvine) e Youngmin Ko (Northwestern), que colaboraram na autoria e na revisão.
Por que isso importa para empresas
Agentes de IA já operam tickets, reembolsos, cadastros e sistemas de rastreamento, mas boa parte da avaliação do setor ainda se concentra no que o modelo escreve. O ThinkingBox desloca o critério para o rastro transacional: o que mudou no banco de dados, em qual valor, e com que estabilidade isso se repete.
Para equipes que pretendem colocar agentes em produção, a diferença entre uma resposta elegante e um estado final correto é exatamente o que separa um piloto de um sistema em que se pode confiar. O artigo original do benchmark detalha ainda os resultados por modelo e os desdobramentos previstos para as próximas versões.







