LangChain transforma traces em evals repetíveis
O skill eval-engineering da LangChain mapeia o harness e o ambiente de um agente, pode minerar traces para casos de falha reais e cria uma tarefa Harbor por vez para rodar e auditar. Por que importa: Um caso tirado de trace só vira teste de regressão quando harness, ambiente e verificador são separados e inspecionáveis. Sem isso, um score verde pode ser resposta vazada, sandbox irreal ou juiz quebrado.
Para testar: Pegue uma falha recorrente do agente. Congele entradas e ambiente, escreva um verificador independente e teste um resultado válido e um erro plausível antes de confiar no score.