Benchmarks de agentes de codificação com custo e tempo de execução
A Artificial Analysis agora compara agentes de codificação em benchmarks de tarefas e também informa custo por tarefa, uso de tokens e tempo de execução. Por que importa: A escolha de agentes não deve se basear apenas em pontuação. Custo, latência e tipo de tarefa determinam se um agente é prático para perguntas sobre repositórios, trabalho em terminal ou geração de patches.
Para testar: Use o índice como checklist de roteamento: compare pelo menos pontuação, preço, tokens e tempo total antes de padronizar um agente de codificação para uma classe de tarefas.