← Voltar à edição2 / 12 · Semana de 14 de set de 2026

SlopCodeBench expõe a lacuna de manutenção em agentes de código

No teste de três problemas de Dex Horthy com o SlopCodeBench, os requisitos foram revelados etapa por etapa e as regressões anteriores seguiram adiante: o Opus 5 liderou com 4 de 17 aprovações estritas, enquanto nenhum modelo concluiu um desafio com todos os testes herdados passando. Por que importa: Um agente pode concluir tickets isolados e ainda deixar a base de código mais difícil de evoluir. Antes de delegar um backlog de longa duração, as equipes precisam de evidências de que cada mudança preserva o comportamento anterior e limita o esforço de correção da próxima etapa.

Para testar: Execute uma tarefa representativa de agente como três requisitos em etapas em um repo descartável. Após cada etapa, rode todos os testes anteriores e compare o diff, as evals com falha e o tempo de correção antes de ampliar o acesso sem supervisão.

Fonte
Dex Horthy — Why Software Factories Fail: Benchmarking the new frontier
conteúdo em inglês
Ver fonte →

Para se aprofundar

Receba o field brief toda semana.

Avanços importantes em IA, boas explicações e recursos práticos em uma leitura semanal. Contexto para entender o que importa, com links para as fontes originais e leituras mais profundas.

Assine grátis →
Grátis toda semana·Sem spam·Cancele quando quiser