Benchmark do Jev da LangChain repete 100 vezes julgamentos fixos de agentes
A LangChain executou novamente cinco saídas fixas de um agente de clima com Jev, GPT-5.6 Luna, GPT-5.6 Terra e Claude Sonnet 4.6, repetindo cada caso 100 vezes e comparando decisões de aprovação ou reprovação com um revisor humano. O Jev coincidiu com os 500 rótulos binários e apresentou variância média por caso 92–913 vezes menor nas notas contínuas de qualidade, com média de 0,44 segundo e US$ 0,00035 por chamada. Por que importa: A escolha do juiz faz parte do harness de avaliação; não é uma chamada de modelo intercambiável. Medir concordância e repetibilidade separadamente pode mostrar se um juiz barato e estável também está alinhado às decisões que o time realmente quer automatizar.
Para testar: Compare o Jev e seu juiz atual executando um rubric limitado 100 vezes sobre cada trace de cinco execuções fixas de produção. Salve os rótulos humanos de referência, taxa de concordância, variância das notas, latência, custo e cada divergência em um relatório de avaliação antes de direcionar mais tráfego a qualquer juiz.
Para se aprofundar
- Repositório de reprodutibilidade ↗
Código, fluxo do conjunto de dados fixo e implementações dos juízes usados na comparação.