Avaliações de revisão de código baseadas em comportamento
O benchmark c-CRAB avalia agentes de revisão de código pelo fato de os comentários de revisão levarem a correções corretas que passam nos testes, em vez de pela similaridade textual com revisões humanas. Por que importa: Para pull requests gerados por agentes, uma prosa de revisão plausível não basta. Os sistemas de revisão precisam de verificações executáveis ou afirmações testáveis que confirmem se uma mudança sugerida realmente melhora o código.
Para testar: Ao usar um revisor de IA, peça passos de reprodução, testes que falham ou um caminho concreto de verificação do patch em vez de aceitar apenas comentários narrativos.