论文

PrivDrift:审计活跃LLM对话中话题漂移下的用户秘密泄漏

PrivDrift: Auditing User-Secret Leakage Under Topic Drift in Active LLM Conversations

模型评测安全与风险评测

摘要

大语言模型越来越多地以持久助手的形式运行在面向用户的、共享会话的和工具增强的场景中。当用户在活跃对话中披露敏感信息后,即使对话随后转向无关话题,这些信息在行为层面仍可能通过后续提示被恢复出来。我们提出PrivDrift,一个用于审计用户所披露秘密在话题漂移和基于说服的探测之后是否仍可被恢复的基准。PrivDrift包含1,000段受控多轮对话,其中埋入了种子秘密、内容密集的漂移轮次和标准化的提取探测。在三个具备长上下文窗口的LLM上,对话级混合泄漏仍然严重,介于38.7%至54.6%之间,并随模型、秘密类型和说服强度显著变化。在测试的漂移窗口内,额外的话题漂移并不能可靠地降低泄漏,这表明活跃LLM上下文中的隐私风险应被视为一种持续存在的行为失效模式来评估,而不仅仅是训练数据记忆或即时越狱行为的问题。

PrivDrift:审计活跃LLM对话中话题漂移下的用户秘密泄漏:论文配图
图 5:各模型按漂移长度与说服强度划分的混合泄露热图。