Juízes LLM em endpoints compartilhados podem variar entre execuções
Um estudo pré-registrado no arXiv sobre observadores LLM de caixa-preta em endpoints compartilhados relata baixa concordância em rankings repetidos na mesma janela e concordância menor quando requisições idênticas foram repetidas no dia seguinte. Por que importa: Se uma pontuação de LLM decide se conteúdo ou código passa por um portão, o rótulo do modelo por si só não demonstra que o portão tomará a mesma decisão amanhã.
Para testar: Execute uma amostra fixa de prompt em um modelo juiz LLM hoje e no dia seguinte. Salve a planilha de concordância, as saídas, o identificador do modelo e o limiar em que a revisão humana assume.