← Voltar à edição26 / 31 · Semana de 6 de jul de 2026

Avaliações interativas de agentes de código medem o custo de correção

SWE-Together avalia agentes de codificação em sessões interativas com usuários, usando tarefas em nível de repositório e medindo tanto a correção final quanto quantos turnos de feedback corretivo são necessários. Por que importa: Um agente de codificação que eventualmente resolve uma tarefa ainda pode ser caro se exigir orientação repetida. Benchmarks interativos tornam visível a sobrecarga de colaboração.

Para testar: Ao comparar agentes de codificação, acompanhe não só sucesso ou falha, mas também turnos de correção, tempo decorrido e se o mesmo padrão de falha se repete entre tarefas.

Fonte
arXiv - SWE-Together
conteúdo em inglês
Ver fonte →

Receba o field brief toda semana.

Um sinal principal, três sinais rápidos, uma coisa para testar, um conceito decodificado - e o resto da semana na linha. Para quem quer saber o que importa e o que fazer a seguir.

Assine grátis →
Grátis toda semana·Sem spam·Cancele quando quiser