Terminal-Bench-Science testa workflows científicos com artefatos verificáveis
O Terminal-Bench-Science 0.1 reúne 70 tarefas curadas por especialistas em cinco áreas científicas e avalia análises, simulações, provas, código e produtos de dados com testes específicos e reproduzíveis. Por que importa: O benchmark faz uma afirmação mais útil que uma demo de pesquisa: se um agente conclui um workflow versionado e deixa um artefato que um verificador consegue inspecionar. A taxa líder de 30% ainda é resultado desta versão, deste harness e desta configuração, não uma medida de autonomia científica geral.
Para testar: Escolha uma tarefa próxima de um workflow analítico interno, inspecione ou execute o script de verificação e registre taxa de resolução, tempo decorrido, intervenção humana e qualidade do artefato antes de automatizar uma etapa científica.