← Voltar à edição11 / 22 · Semana de 27 de jul de 2026

OSReward testa juízes de uso de computador contra falhas

O OSReward avalia juízes visão-linguagem em trajetórias de uso de computador com vereditos conferidos por humanos. Os autores relatam que os juízes avaliados marcam algumas execuções falhas como sucesso e liberam dados do benchmark e modelos de recompensa. Por que importa: A mensagem de conclusão do modelo é um sinal fraco quando o agente mexeu no navegador ou no desktop. Uma avaliação barata pode encurtar a revisão e ainda aceitar silenciosamente um estado quebrado.

Para testar: Em uma tarefa de uso de computador, exija uma prova externa — arquivo salvo, resposta de API ou asserção de interface — e compare-a com o veredito do juiz nas execuções que falham.

Fonte
arXiv / OSReward authors
conteúdo em inglês
Ver fonte →

Receba o field brief toda semana.

Um sinal principal, três sinais rápidos, uma coisa para testar, um conceito decodificado - e o resto da semana na linha. Para quem quer saber o que importa e o que fazer a seguir.

Assine grátis →
Grátis toda semana·Sem spam·Cancele quando quiser