The Tasteful Agent: medindo o bom critério de agentes

shape
shape
shape
shape
shape

The Tasteful Agent: medindo o bom critério de agentes

The Tasteful Agent: medindo o bom critério de agentes

Pesquisadores propõem que o "gosto" de um agente de IA, a capacidade de tomar boas decisões de longo prazo, pode ser medido automaticamente. Sem anotação de especialistas, a partir das próprias trajetórias que os agentes já produzem.

O método explora "bifurcações de decisão" (decision forks), pontos em que tentativas da mesma tarefa divergem e onde o desfecho posterior funciona como rótulo. O resultado é o Taste-Bench, com 502 questões em engenharia de software e pesquisa em aprendizado de máquina.

Os autores de Wenbo Pan e colegas afirmam que ele é escalável e treinável.

O que os autores propõem

No paper The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks, Wenbo Pan, Zhichao Liu, Shujie Liu, Jingying Zeng, Chin-Yew Lin, Xianfeng Tang, Yan Lu, Qi He e Xiaohua Jia formalizam o "gosto" de um agente como sua habilidade de escolher a melhor direção em uma bifurcação de decisão. Segundo os autores, essa habilidade pode ser medida a partir de evidências retrospectivas extraídas de trajetórias já existentes, sem depender de especialistas humanos.

A proposta combina três elementos. O primeiro é uma definição operacional: gosto é a capacidade de escolher, no momento da decisão, o ramo cujo desfecho posterior se revela superior.

O segundo é um processo de mineração que transforma trajetórias brutas em perguntas de múltipla escolha rotuladas. O terceiro é o Taste-Bench, um benchmark que reúne essas perguntas e serve tanto para avaliar quanto para treinar modelos.

Os autores também argumentam que o gosto é treinável: destilar o raciocínio de um professor que conhece a direção correta melhora o julgamento em tarefas inéditas e produz ganhos ponta a ponta.

Contexto: qual problema está sendo atacado

Agentes baseados em LLMs executam tarefas cada vez mais longas. Conduzem pesquisa em aprendizado de máquina do início ao paper, evoluem grandes projetos de software entre releases e refinam seus próprios scaffolds em produção.

Nesse regime, o agente toma decisões cujo impacto não se limita ao passo atual: qual hipótese testar, sobre qual implementação construir, qual experimento rodar em seguida.

O problema, dizem os autores, é que uma decisão errada costuma parecer razoável no momento em que é tomada. Seu custo só aparece muito depois, quando boa parte do orçamento já foi gasto.

Benchmarks existentes medem desempenho ponta a ponta e informam apenas se o agente terminou a tarefa, não a qualidade das decisões ao longo do caminho. Medir essas decisões diretamente é difícil justamente porque o resultado de uma decisão de longo prazo não é visível de imediato.

Julgar a qualidade exige expertise de domínio, o que torna a anotação humana cara e pouco escalável para novos domínios.

A pergunta que os autores colocam é se o gosto de um agente pode ser medido automaticamente. A observação-chave é que a parte posterior de uma trajetória fornece evidência retrospectiva para as decisões anteriores.

Como funciona

A unidade básica é a bifurcação de decisão. Quando tentativas da mesma tarefa compartilham um prefixo equivalente e depois divergem em duas direções candidatas, o desfecho de cada ramo identifica qual era a melhor escolha.

Os autores congelam a trajetória na bifurcação, escondem todo o trabalho posterior e pedem a um modelo que escolha entre as duas direções. O rótulo é o candidato cujo ramo produziu o melhor resultado, medido por evidências como testes automatizados ou escores de pesquisa.

As bifurcações são mineradas de duas formas complementares. A primeira usa trajetórias paralelas, em que tentativas independentes da mesma tarefa divergem e os desfechos registrados identificam o candidato apoiado.

São os erros que o agente comete sem perceber. A segunda usa trajetórias com desvios (detours), em que o agente se corrige dentro de uma única execução: um modelo gerador localiza o passo em que o agente toma uma direção, a falha observada que encerra essa direção e o passo em que ele adota um caminho diferente que conclui a tarefa.

A bifurcação é posicionada imediatamente antes da direção abandonada, e a pergunta testa se o modelo avaliado consegue reconhecer a falha antes do agente que a cometeu.

O pipeline cobre dois domínios. O pool de engenharia reúne 2.677 rollouts avaliados, obtidos rodando agentes GPT-5.4 e GPT-5.5 em 517 tarefas do SWE-bench Pro. O pool de pesquisa contém 1.132 execuções de agentes em 47 tarefas de P&D em IA do RE-Bench e do subconjunto de pesquisa do HCAST, baixadas do MALT, a liberação pública de transcrições da METR, disponível em metr-evals/malt-public.

As bifurcações candidatas passam por um filtro. Perguntas "triviais", aquelas em que a resposta pode ser adivinhada apenas pelo texto das duas alternativas, são removidas por um conjunto de modelos juízes que respondem sem ver a trajetória.

Perguntas "indecidíveis", cujo desfecho registrado não é claramente consistente com o rótulo, também são descartadas. Só entram na versão final as perguntas em que ao menos um juiz erra quando a trajetória está oculta e todos os juízes concordam com o rótulo quando o registro completo está visível.

O gerador propôs 4.657 bifurcações candidatas dos dois pools, das quais 10,8% passaram por todos os filtros, resultando nas 502 questões. A composição cruza construção (paralela ou desvio) com domínio: engenharia fornece 390 questões e pesquisa, 112.

Resultados reportados

Os autores avaliaram 14 modelos contemporâneos, cobrindo as principais famílias de fronteira: Claude, GPT, Grok, DeepSeek, GLM, MiniMax e Mistral. Todos sob a mesma interface e o mesmo orçamento de tokens.

Para lidar com viés de posição, cada questão é avaliada duas vezes: uma na ordem determinística com semente e outra na ordem exatamente inversa. Uma questão só conta como correta quando ambas as ordens são respondidas corretamente, de modo que respostas que mudam com a ordem não contam como gosto.

Os autores também reportam a acurácia média sobre as duas ordens.

Sobre a qualidade dos rótulos, os autores conduziram uma revisão humana de 100 questões amostradas, em que dois revisores escolheram separadamente uma direção e depois viram resumos das continuações e desfechos registrados. Dos 172 julgamentos com preferência A/B explícita, 170 concordaram com o rótulo minerado, 98,8% de concordância.

Nas 74 questões em que ambos os revisores escolheram A ou B, a concordância entre eles foi de 98,6%.

Os autores afirmam ainda que as questões ficam mais difíceis conforme o horizonte temporal da bifurcação aumenta. E que destilar o raciocínio de um professor com acesso à direção correta melhora o julgamento em tarefas não vistas e gera ganhos ponta a ponta em tarefas de agente mantidas de fora.

O extrato disponível interrompe a seção de resultados exatamente na definição da métrica primária, de modo que os números de acurácia por modelo não estão disponíveis neste material.

Limitações e o que não foi provado

O material disponível não traz a tabela completa de resultados, nem os valores de acurácia por modelo, nem a magnitude dos ganhos de treinamento. O valor do coeficiente kappa de Cohen entre revisores também aparece truncado no extrato, o que impede avaliar a concordância além da taxa bruta.

Há limitações estruturais no método. A construção depende de que existam trajetórias com prefixos equivalentes e desfechos divergentes.

Essa situação pode não ocorrer em domínios onde a execução é ruidosa ou onde as tarefas têm poucas tentativas paralelas. Os autores reconhecem que o desfecho de uma trajetória isolada não mostra se um julgamento foi bom ou ruim, porque qualidade de execução e ambiente também determinam o resultado.

Por isso mantêm apenas bifurcações cujo desfecho decorre claramente do julgamento. Ainda assim, resta a questão de quantas decisões reais cabem nesse critério.

A cobertura é concentrada em dois domínios: engenharia de software e pesquisa em aprendizado de máquina. Os autores não demonstram que o gosto medido no Taste-Bench transfere para outras áreas.

A mineração usa modelos geradores e juízes, o que introduz dependência dos próprios modelos avaliados. E a revisão humana, embora expressiva em concordância, cobre apenas 100 das 502 questões.

Por que isso importa para quem constrói com IA

Para quem desenvolve agentes, o argumento central é prático: se o gosto é uma capacidade separável e mensurável, ele pode virar um alvo de otimização. Hoje, times ajustam agentes por recompensa final, tarefa concluída ou não.

O paper sugere avaliar a qualidade das decisões intermediárias, aproveitando o trabalho que os agentes já realizam. Isso escala com a produção de trajetórias, em vez de exigir anotação especialista por domínio.

A distinção entre trajetórias paralelas e desvios também é útil operacionalmente. Bifurcações paralelas capturam erros silenciosos: decisões ruins que o agente nunca percebe e que ainda assim levam a execução até o fim.

Bifurcações de desvio capturam erros que o próprio agente corrige, mas tarde demais. Para quem projeta scaffolds, isso indica onde investir: detecção precoce de falhas que o agente já sabe reconhecer, e heurísticas que evitem caminhos plausíveis mas custosos.

O código e o dataset estão públicos em wbopan/tastebench e wenbopan/taste-bench, o que permite reproduzir a avaliação e testar a transferência para outros domínios. Vale tratar os resultados como afirmações dos autores.

Sem a tabela completa de acurácia e sem replicação independente, a promessa de que o gosto é treinável segue como hipótese aberta. Mas é uma hipótese com uma metodologia concreta e verificável.

Referências

  • PAN, Wenbo; LIU, Zhichao; LIU, Shujie; ZENG, Jingying; LIN, Chin-Yew; TANG, Xianfeng; LU, Yan; HE, Qi; JIA, Xiaohua. The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks. arXiv:2609.25804. Disponível em: https://arxiv.org/abs/2609.25804
  • Dataset Taste-Bench: https://huggingface.co/datasets/wenbopan/taste-bench
  • Código Taste-Bench: https://github.com/wbopan/tastebench
  • Transcrições públicas MALT (METR): https://huggingface.co/datasets/metr-evals/malt-public

Últimos Artigos

The Tasteful Agent: medindo o bom critério de agentes
WROP: ensinar permanência de objeto a modelos de mundo em vídeo
OmniEdu: modelos abertos que unem ensino e aprendizagem em K-12
Realtime-Venus: diálogo full-duplex com delegação assíncrona