← Voltar à edição1 / 29 · Semana de 29 de jun de 2026

Avaliações de agentes precisam checar rastros e custos

A orientação da Anthropic para avaliação de agentes trata a qualidade como o comportamento combinado do modelo, harness, ferramentas e ambiente, não apenas como uma pontuação do modelo. Por que importa: Agentes confiáveis precisam de verificações repetíveis de sucesso da tarefa, erros de ferramentas, latência, uso de tokens e custo antes de serem usados em trabalho recorrente.

Para testar: Crie um conjunto de três casos de avaliação para uma tarefa de agente e avalie tanto o artefato final quanto sinais no rastro, como fontes ausentes, chamadas de ferramenta falhas e uso excessivo de tokens.

Hacker News 5 pts · jul 4verificar ↗
Fonte
Anthropic Engineering - Demystifying evals for AI agents
conteúdo em inglês
Ver fonte →

Receba o field brief toda semana.

Um sinal principal, três sinais rápidos, uma coisa para testar, um conceito decodificado - e o resto da semana na linha. Para quem quer saber o que importa e o que fazer a seguir.

Assine grátis →
Grátis toda semana·Sem spam·Cancele quando quiser