Em 19 de setembro de 2026, a LangChain publicou um experimento que coloca o Jev, modelo da TypeSafe AI, no papel de juiz automático de avaliação de agentes de inteligência artificial. A pergunta central era direta: um modelo "System One" pode avaliar agentes melhor do que os juízes baseados em LLMs usados hoje?
Para responder, a empresa comparou as duas abordagens em quatro dimensões: acurácia, repetibilidade, latência e custo. A conclusão é que os resultados são promissores, ainda que preliminares.
Um avaliador que não gera texto
O Jev não é um LLM tradicional. Ele não produz texto.
A TypeSafe AI o descreve como um modelo "System One", uma classe criada para tomar decisões rápidas e estruturadas que o software pode consumir direto. Na prática, ele avalia um estado e devolve respostas tipadas com probabilidades.
Não chega a um veredito por geração token a token.
Segundo a empresa, esse desenho rende até 200 vezes mais velocidade de inferência e custo até 400 vezes menor que LLMs comparáveis em tarefas de classificação.
O gargalo da avaliação de agentes
Hoje a avaliação de agentes se divide em duas famílias.
A primeira é a avaliação baseada em código, tão antiga quanto a própria programação: barata, rápida e confiável, mas limitada a problemas estreitos, com entradas determinísticas. Uma função tradicional consegue verificar se o agente chamou uma ferramenta na primeira execução.
Tem dificuldade, porém, para julgar se ele usou o resultado dessa ferramenta para responder à pergunta do usuário. Em tarefas abertas há vários caminhos válidos, e codificar todos eles como lógica determinística esbarra rápido nesse limite.
A segunda família é o LLM-as-a-judge, que usa um modelo de linguagem para raciocinar sobre o trace não estruturado do agente e atribuir uma nota. Funciona melhor com entradas abertas, mas não é solução perfeita.
Juízes LLM são sistemas não determinísticos, o que não é base sólida para um aparato de testes, além de serem mais lentos e mais caros.
A LangChain argumenta que avaliar agentes é, no fundo, uma tarefa de decisão: dado o estado e o comportamento do agente, atribuir uma nota que sirva de feedback. É exatamente o padrão para o qual o Jev foi desenhado.
Como o jev responde
O modelo trabalha com perguntas tipadas.
No tipo Choice, ele seleciona uma opção e devolve probabilidades e confiança. Um exemplo citado é verificar se a resposta final está ancorada na evidência recuperada, com retorno em ponto flutuante de 0,0 a 1,0.
Nesse caso, 1,0 significa totalmente ancorada.
No tipo Score, avalia a resposta contra uma rubrica ordenada, com nota de 1 (pouco útil) a 5 (muito útil), também acompanhada de probabilidades e confiança. Há ainda um terceiro formato, voltado a julgamentos de sim ou não, que devolve a probabilidade de a afirmação ser verdadeira.
O ponto central é que a saída estruturada é nativa do modelo, sem conversão posterior.
Os números do teste
Na pontuação contínua, a diferença de consistência foi o resultado mais chamativo. A variância das notas de qualidade do Jev ficou entre 92 e 913 vezes menor que a de GPT-5.6 Luna, Terra e Claude Sonnet 4.6.
O Jev também foi o mais rápido e o mais barato do comparativo, com média de 0,44 segundo por chamada e custo de US$ 0,00035 por chamada. No total, o experimento custou US$ 0,34 com o Jev, contra US$ 28,17 com o Claude.
Por que isso importa
A LangChain afirma que o teste é estreito e os resultados são iniciais. Não se trata de um veredito definitivo sobre juízes LLM.
Ainda assim, a empresa diz que o desempenho do Jev aponta para uma direção promissora: a de um terceiro tipo de avaliador de agentes, ao lado do código e dos juízes baseados em LLM, com potencial para viabilizar avaliações online em escala. A companhia também anunciou uma transmissão ao vivo com a equipe da TypeSafe AI para discutir a construção de um harness com o Jev, com inscrições na página de eventos da LangChain.
Fontes e links
- LangChain
- TypeSafe AI — Introducing System One models and Jev
- TypeSafe AI, documentação sobre estados
- LangSmith, LLM-as-a-judge







