← Voltar à edição5 / 13 · Semana de 31 de ago de 2026

Juízes LLM em endpoints compartilhados podem variar entre execuções

Um estudo pré-registrado no arXiv sobre observadores LLM de caixa-preta em endpoints compartilhados relata baixa concordância em rankings repetidos na mesma janela e concordância menor quando requisições idênticas foram repetidas no dia seguinte. Por que importa: Se uma pontuação de LLM decide se conteúdo ou código passa por um portão, o rótulo do modelo por si só não demonstra que o portão tomará a mesma decisão amanhã.

Para testar: Execute uma amostra fixa de prompt em um modelo juiz LLM hoje e no dia seguinte. Salve a planilha de concordância, as saídas, o identificador do modelo e o limiar em que a revisão humana assume.

Fonte
arXiv — Clean Engineering, Unstable Measurement
conteúdo em inglês
Ver fonte →

Receba o field brief toda semana.

Avanços importantes em IA, boas explicações e recursos práticos em uma leitura semanal. Contexto para entender o que importa, com links para as fontes originais e leituras mais profundas.

Assine grátis →
Grátis toda semana·Sem spam·Cancele quando quiser