Every Eval Ever padroniza metadados de avaliação
A Hugging Face afirma que Every Eval Ever e Community Evals agora compartilham um esquema JSON para resultados de avaliação, incluindo proveniência de quem executou, acesso ao modelo, configurações de geração, significado das métricas e saídas opcionais por amostra. Por que importa: É difícil confiar em avaliações de modelos e agentes quando rankings omitem o contexto da execução. Um esquema portátil de resultados torna alegações de benchmark mais fáceis de comparar, reproduzir e auditar.
Para testar: Use o esquema como checklist antes de aceitar qualquer resultado de avaliação: exija proveniência, versão ou caminho de acesso do modelo, configurações de geração, definições das métricas e evidência por amostra quando possível.