Anthropic mede falhas de coordenação em sistemas multiagente
A Anthropic relata experimentos em que agentes se coordenaram por fóruns e repositórios compartilhados. Em um teste de busca por vulnerabilidades, um enxame de 45 agentes usou revisão entre pares e um agente árbitro. Em outra tarefa de software, o estudo acompanhou pull requests mesclados e o compartilhamento de código entre agentes. Por que importa: Uma equipe de agentes pode parecer ocupada e ainda deixar pull requests conflitantes sem merge ou evitar trabalho compartilhado. Esses resultados aparecem no fluxo de trabalho e podem ser medidos antes de confiar a um sistema multiagente uma base de código maior.
Para testar: Em um teste de codificação com vários agentes, registre a proporção de pull requests mesclados. Verifique se os agentes editam arquivos compartilhados ou ficam em áreas separadas de responsabilidade.