论文

对良性事实的强化学习会加剧记忆私人数据的泄露

Reinforcement Learning on Benign Facts Amplifies Leakage of Memorized Private Data

模型评测安全与风险评测

摘要

部署具有可验证奖励的强化学习(RLVR)是为了使模型更好地执行推理任务,但其对模型将泄露的内容的副作用仍在研究中。在这里,我们展示了基于事实的 RLVR 增加了指令模型已经记住的个人身份信息 (PII) 的提取。我们首先确认指导模型已经记住了 PII,但将它们隐藏起来,很少在被问到时浮现出来。然后,我们将强化学习应用于不包含任何类型的 PII 的良性事实数据,并重新探测:对名称->电子邮件对进行有针对性的探测,以及无目标的自由回忆提示,仅要求模型列出它知道的地址。在这两种情况下,PII 提取都急剧上升:在 DeepSeek-V3.1 上,逐字召回@k 从 0.155 增加到 0.370,增益为 2.4 倍。效果随模型大小而变化:在涵盖 8B 至 671B 参数的三个模型中,最大模型中的绝对泄漏最大。同时模型的推理能力和拒绝率被保留,这表明强化学习选择性地改变了哪些记忆的信息是可访问的,而不是广泛地改变模型。总之,通过从未接触过的训练,可以使记忆的私人数据明显更容易提取。这为对手提供了一条获取记忆数据的途径,不需要与隐私相关的训练信号,也不需要访问数据本身——只需要对无害的东西进行微调的能力。