论文

语言模型中无意的上下文泄漏

Inadvertent Context Leakage in Language Models

模型评测安全与风险评测

摘要

为了让人工智能代理在简单的聊天之外发挥作用,它们必须保存敏感的用户上下文,例如日历、凭证、健康记录和财务数据。我们研究模型上下文窗口中仅存在此类秘密是否会在模型的良性输出中引入隐藏的相关性,即使模型正确地拒绝直接提取,也允许重建。我们进一步研究对手是否可以主动设计提示来放大这种效果,使用该模型作为隐蔽载体,通过看似无害的文本传输秘密。在这两种情况下,这种有限的泄漏都是通过一种新颖的自适应攻击来利用的,该攻击假设对底层模型进行黑盒访问。在八个专有模型的受控实验中,我们发现 2 位上下文秘密的重建精度近乎完美,4 位秘密的精确匹配率为 82%,所有这些都来自模型响应普通非对抗性请求而生成的输出。我们观察到,能力更强的模型泄漏更多:更强的指令遵循会增强对上下文秘密的敏感性,这表明泄漏是能力的副产品,而不是可修补的错误。我们证明这种泄漏可以实现两种实际攻击:(1)训练有素的分类器,从常规自然语言输出中推断出有关用户记忆的语义谓词(例如,健康状况、财务事件);(2)经过强化学习训练的对手,可以从生产式代理中提取完整的社会保障号码。