OSReward testa juízes de uso de computador contra falhas
O OSReward avalia juízes visão-linguagem em trajetórias de uso de computador com vereditos conferidos por humanos. Os autores relatam que os juízes avaliados marcam algumas execuções falhas como sucesso e liberam dados do benchmark e modelos de recompensa. Por que importa: A mensagem de conclusão do modelo é um sinal fraco quando o agente mexeu no navegador ou no desktop. Uma avaliação barata pode encurtar a revisão e ainda aceitar silenciosamente um estado quebrado.
Para testar: Em uma tarefa de uso de computador, exija uma prova externa — arquivo salvo, resposta de API ou asserção de interface — e compare-a com o veredito do juiz nas execuções que falham.