Avaliações de agentes precisam checar rastros e custos
A orientação da Anthropic para avaliação de agentes trata a qualidade como o comportamento combinado do modelo, harness, ferramentas e ambiente, não apenas como uma pontuação do modelo. Por que importa: Agentes confiáveis precisam de verificações repetíveis de sucesso da tarefa, erros de ferramentas, latência, uso de tokens e custo antes de serem usados em trabalho recorrente.
Para testar: Crie um conjunto de três casos de avaliação para uma tarefa de agente e avalie tanto o artefato final quanto sinais no rastro, como fontes ausentes, chamadas de ferramenta falhas e uso excessivo de tokens.