Evals de percurso para ferramentas de agentes
A Hugging Face argumenta que ferramentas voltadas a agentes devem ser avaliadas pelo percurso que o agente faz, não apenas por a resposta final estar correta. Por que importa: Para automação prática, turnos, tokens, latência, erros, chamadas de API e adequação da documentação podem determinar se uma ferramenta é confiável o bastante para uso recorrente por agentes.
Para testar: Ao testar uma CLI, um servidor MCP ou uma API com um agente, registre o percurso de comandos, tentativas, uso de tokens, tempo decorrido e se os exemplos levaram o agente à interface pretendida.