Um preprint testa vazamento de segredos deixados no contexto do modelo
O preprint “Inadvertent Context Leakage in Language Models” testa se segredos apenas presentes na janela de contexto podem ser inferidos a partir de respostas comuns do modelo. Em experimentos controlados com oito modelos proprietários, os autores relatam reconstrução quase perfeita de segredos de dois dígitos e 82% de correspondência exata para segredos de quatro dígitos. Por que importa: O resultado trata de um ataque controlado, não de uma constatação de produção para todos os fornecedores. Ainda assim, é um motivo para não deixar credenciais, dados pessoais sem relação com a tarefa ou memória persistente no contexto quando eles não forem necessários.
Para testar: Revise o contexto persistente de um agente e remova valores de credenciais, dados pessoais sem relação com a tarefa ou memórias que não sejam necessários para a próxima execução.