HANDBOOK.md testa aderência a políticas com uso real de ferramentas
O HANDBOOK.md apresenta 65 tarefas para agentes em ambientes corporativos simulados, nos quais eles precisam seguir procedimentos de 20 a 124 páginas enquanto usam serviços de e-mail, chat, calendário, issues e comércio conectados por MCP. Por que importa: Arquivos longos de política parecem camadas de controle até o agente precisar carregar suas regras por uma sequência de ferramentas. O benchmark avalia ações exigidas e proibidas com 824 critérios programáticos, para que uma resposta final plausível não esconda um processo quebrado.
Para testar: Leia a rubrica de uma tarefa antes de confiar em uma abordagem baseada em arquivo de política. Confira se a avaliação testa ações proibidas e conflitos de regra, não só a conclusão da tarefa.