← Voltar à edição5 / 29 · Semana de 15 de jun de 2026

Avaliações de revisão de código baseadas em comportamento

O benchmark c-CRAB avalia agentes de revisão de código pelo fato de os comentários de revisão levarem a correções corretas que passam nos testes, em vez de pela similaridade textual com revisões humanas. Por que importa: Para pull requests gerados por agentes, uma prosa de revisão plausível não basta. Os sistemas de revisão precisam de verificações executáveis ou afirmações testáveis que confirmem se uma mudança sugerida realmente melhora o código.

Para testar: Ao usar um revisor de IA, peça passos de reprodução, testes que falham ou um caminho concreto de verificação do patch em vez de aceitar apenas comentários narrativos.

Fonte
arXiv paper
conteúdo em inglês
Ver fonte →

Receba o field brief toda semana.

Um sinal principal, três sinais rápidos, uma coisa para testar, um conceito decodificado - e o resto da semana na linha. Para quem quer saber o que importa e o que fazer a seguir.

Assine grátis →
Grátis toda semana·Sem spam·Cancele quando quiser