← Voltar à edição1 / 12 · Semana de 14 de set de 2026

Benchmark do Jev da LangChain repete 100 vezes julgamentos fixos de agentes

A LangChain executou novamente cinco saídas fixas de um agente de clima com Jev, GPT-5.6 Luna, GPT-5.6 Terra e Claude Sonnet 4.6, repetindo cada caso 100 vezes e comparando decisões de aprovação ou reprovação com um revisor humano. O Jev coincidiu com os 500 rótulos binários e apresentou variância média por caso 92–913 vezes menor nas notas contínuas de qualidade, com média de 0,44 segundo e US$ 0,00035 por chamada. Por que importa: A escolha do juiz faz parte do harness de avaliação; não é uma chamada de modelo intercambiável. Medir concordância e repetibilidade separadamente pode mostrar se um juiz barato e estável também está alinhado às decisões que o time realmente quer automatizar.

Para testar: Compare o Jev e seu juiz atual executando um rubric limitado 100 vezes sobre cada trace de cinco execuções fixas de produção. Salve os rótulos humanos de referência, taxa de concordância, variância das notas, latência, custo e cada divergência em um relatório de avaliação antes de direcionar mais tráfego a qualquer juiz.

Fonte
LangChain — Jev-as-a-Judge for Agent Evals
conteúdo em inglês
Ver fonte →

Para se aprofundar

Receba o field brief toda semana.

Avanços importantes em IA, boas explicações e recursos práticos em uma leitura semanal. Contexto para entender o que importa, com links para as fontes originais e leituras mais profundas.

Assine grátis →
Grátis toda semana·Sem spam·Cancele quando quiser