LangSmith passa a usar Jev como juiz em avaliações de agentes

LangSmith passa a usar Jev como juiz em avaliações de agentes

A LangChain anunciou em 21 de setembro de 2026 que o Jev passou a estar disponível como juiz nas avaliações do LangSmith, sua plataforma de observabilidade e avaliação de agentes. Com a novidade, equipes de desenvolvimento ganham uma maneira rápida e de baixo custo de julgar comportamentos abertos de agentes.

O resultado vira feedback estruturado que pode ser acompanhado dentro do próprio LangSmith. O recurso já pode ser experimentado na aba Evaluators de qualquer projeto de tracing.

Uma terceira via para avaliar agentes

Quando a LangChain começou a construir agentes, em 2023, o caminho principal de avaliação era baseado em código. Ainda naquele ano, pesquisadores apresentaram a abordagem de LLM-as-a-judge.

Desde então, esses dois métodos dividiram o trabalho de avaliar agentes.

Avaliadores baseados em código verificam condições determinísticas. Checam se o agente chamou determinada ferramenta, se a saída corresponde a um padrão, se um campo está presente.

São rápidos e confiáveis, mas cobrem apenas a fatia estreita do comportamento que é possível especificar antes da execução.

Agentes são não determinísticos. Um agente que resolve o mesmo problema de três formas válidas diferentes falha em uma checagem que espera apenas uma delas.

Os avaliadores de LLM-as-a-judge preenchem essa lacuna. Recebem um trace do agente, instruções e uma rubrica de correção.

Raciocinam em texto livre antes de devolver um veredito.

A flexibilidade tem preço. São mais lentos e mais caros que uma chamada de função.

Por serem não determinísticos, podem dar respostas diferentes para a mesma entrada. A etapa que transforma texto livre em saída estruturada é, por si só, uma fonte de erro, mesmo quando o raciocínio do juiz está correto.

O que é o jev

Segundo a LangChain, modelos System One como o Jev introduzem um terceiro tipo de avaliação de agentes. A abordagem troca parte da velocidade do método baseado em código pela flexibilidade de julgar comportamentos abertos, a uma fração do custo de um juiz baseado em LLM.

O Jev não é um LLM tradicional e não gera texto. A equipe da TypeSafe AI o descreve como um modelo System One, classe de modelos construída para tomar decisões estruturadas rápidas que o software consegue usar diretamente.

Ele avalia um estado e devolve respostas tipadas e probabilidades.

Em avaliações, esse estado pode ser um trace de agente, uma única mensagem ou qualquer outro contexto que se queira julgar. As perguntas definem os critérios aplicados ao estado, como verificar se uma resposta vazou dados pessoais, qual era a intenção do usuário ou o quão frustrado ele parecia.

O Jev responde a três tipos de pergunta. O noul devolve uma probabilidade de sim ou não.

O choice escolhe uma opção dentro de um conjunto. O score atribui uma nota em escala ordenada.

Cada resposta volta tipada, em vez de um bloco de texto gerado que precisa ser convertido em saída estruturada.

No exemplo citado pela LangChain, as chaves de feedback seriam vazamento de PII (noul), intenção do usuário (choice) e frustração do usuário (score).

Por que isso importa para o custo das avaliações

Três características do Jev atacam pontos de dor comuns na avaliação de agentes. De acordo com a TypeSafe AI, ele é até cerca de 450 vezes mais barato e cerca de 200 vezes mais rápido que LLMs comparáveis em tarefas de classificação.

Também pode avaliar várias perguntas sobre o mesmo estado em paralelo.

O custo é um dos motivos mais frequentes para equipes avaliarem seus agentes menos do que gostariam. Toda avaliação envolve um trade-off.

Pontuar mais execuções de agente, aplicar mais critérios ou testar mais alterações faz o custo de teste crescer na mesma proporção.

Com vários agentes e uso em alto volume, um juiz baseado em LLM que custa alguns centavos por avaliação fica caro rapidamente. Isso vale ao longo do tráfego de produção, de grandes conjuntos de dados e de testes de regressão contra cada mudança de modelo ou de prompt.

O resultado é que as equipes acabam rodando menos avaliações para controlar gastos. Isso desacelera o ciclo de feedback do qual depende a construção de bons agentes.

Com uma fração desse custo, um juiz Jev elimina essa escolha.

Na prática, isso permite pontuar todos os traces em vez de apenas uma amostra deles. Também permite checar mais critérios por trace e repetir o mesmo julgamento várias vezes para medir a consistência do avaliador.

A velocidade pesa nas avaliações online, em que o juiz precisa pontuar tráfego ao vivo. Segundo a TypeSafe AI, o Jev é até cerca de 200 vezes mais rápido que alternativas baseadas em LLM em tarefas de classificação.

Como usar

A ativação não exige configuração complexa. Basta acessar a aba Evaluators em qualquer projeto de tracing do LangSmith e configurar um avaliador com o Jev como juiz, inclusive para avaliações online.

A LangChain afirma que a abordagem cobre desde execuções de produção até conjuntos de dados e testes de regressão. Isso aproxima a avaliação contínua de agentes de um custo operacional viável em escala.

Fontes e links

Matéria publicada originalmente em LangChain

Últimas Notícias

LangSmith passa a usar Jev como juiz em avaliações de agentes
NVIDIA lança DSX Ready para qualificar energia e resfriamento de IA
Grok 4.6 da xAI chega ao Amazon Bedrock com 500 mil tokens
OpenAI cria grupo de matemática após IA resolver 100 problemas