← Voltar à edição3 / 13 · Semana de 31 de ago de 2026

Terminal-Bench-Science testa workflows científicos com artefatos verificáveis

O Terminal-Bench-Science 0.1 reúne 70 tarefas curadas por especialistas em cinco áreas científicas e avalia análises, simulações, provas, código e produtos de dados com testes específicos e reproduzíveis. Por que importa: O benchmark faz uma afirmação mais útil que uma demo de pesquisa: se um agente conclui um workflow versionado e deixa um artefato que um verificador consegue inspecionar. A taxa líder de 30% ainda é resultado desta versão, deste harness e desta configuração, não uma medida de autonomia científica geral.

Para testar: Escolha uma tarefa próxima de um workflow analítico interno, inspecione ou execute o script de verificação e registre taxa de resolução, tempo decorrido, intervenção humana e qualidade do artefato antes de automatizar uma etapa científica.

Hacker News 117 pts · ago 31verificar ↗
Fonte
Terminal-Bench-Science — 0.1 announcement
conteúdo em inglês
Ver fonte →

Receba o field brief toda semana.

Avanços importantes em IA, boas explicações e recursos práticos em uma leitura semanal. Contexto para entender o que importa, com links para as fontes originais e leituras mais profundas.

Assine grátis →
Grátis toda semana·Sem spam·Cancele quando quiser