SlopCodeBench expõe a lacuna de manutenção em agentes de código
No teste de três problemas de Dex Horthy com o SlopCodeBench, os requisitos foram revelados etapa por etapa e as regressões anteriores seguiram adiante: o Opus 5 liderou com 4 de 17 aprovações estritas, enquanto nenhum modelo concluiu um desafio com todos os testes herdados passando. Por que importa: Um agente pode concluir tickets isolados e ainda deixar a base de código mais difícil de evoluir. Antes de delegar um backlog de longa duração, as equipes precisam de evidências de que cada mudança preserva o comportamento anterior e limita o esforço de correção da próxima etapa.
Para testar: Execute uma tarefa representativa de agente como três requisitos em etapas em um repo descartável. Após cada etapa, rode todos os testes anteriores e compare o diff, as evals com falha e o tempo de correção antes de ampliar o acesso sem supervisão.
Para se aprofundar
- Artigo do SlopCodeBench ↗
O desenho do benchmark, a avaliação com 20 problemas e os resultados relatados de degradação da qualidade.
- Conjunto de problemas do SCBench ↗
Especificações por etapa, soluções de referência e testes de regressão herdados usados pelo benchmark.