论文
Chain-of-Sanitized-Thoughts:堵住大推理模型思维链中的PII泄漏
Chain-of-Sanitized-Thoughts: Plugging PII Leakage in CoT of Large Reasoning Models
摘要
大型推理模型(LRM)通过生成显式思维链(CoT)推理来提升性能、可靠性和可解释性,但这种透明性带来了严重的隐私风险:即使最终答案经过清洗,中间推理过程也常常泄露个人身份信息(PII)。我们研究如何诱导隐私优先的推理,即模型在不暴露敏感信息的情况下进行推理,且采用可部署的干预手段而非事后删改。我们引入 PII-CoT-Bench,一个带有隐私感知 CoT 标注的监督数据集,以及一个覆盖现实与对抗性泄露场景的类别均衡评测基准。我们的结果揭示了一种依赖能力的趋势:最先进的模型从基于提示的干预中获益最多,而较弱的模型则需要微调才能实现有意义的泄露减少。在各类模型和类别上,两种方法都在效用几乎不退化的前提下大幅降低了 PII 暴露,表明可以在不牺牲性能的情况下实现隐私化推理。总体而言,我们证明隐私化的 CoT 推理可以在极小效用损失下实现,为构建隐私保护的推理系统提供了实用指导。
