Evals de RAG precisam testar contexto enganoso
Um novo artigo sobre confiabilidade de RAG avalia comportamento com recuperação limpa, enganosa e mista, incluindo casos em que o contexto recuperado entra em conflito com o conhecimento existente do modelo. Por que importa: Testes de recuperação apenas no caminho feliz deixam passar uma falha comum: contexto irrelevante ou contaminado pode aumentar a confiança enquanto afasta a resposta da verdade.
Para testar: Adicione pelo menos um caso de contexto misto e um de contexto enganoso a uma avaliação de recuperação, depois acompanhe se o sistema cita, rejeita ou confia demais no contexto ruim.