论文
STaR:面向大推理模型遗忘的敏感轨迹调控
STaR: Sensitive Trajectory Regulation for Unlearning in Large Reasoning Models
摘要
大型推理模型(LRM)推动了自动化多步推理的进步,但其生成复杂思维链(CoT)轨迹的能力带来严重隐私风险:敏感信息可能深嵌于推理全程。现有大语言模型(LLM)遗忘方法通常只修改最终答案,对LRM并不充分,因为它们无法从中间步骤移除敏感内容,导致持续的隐私泄漏与安全性退化。为应对这些挑战,我们提出Sensitive Trajectory Regulation(STaR),一个无参数、推理时的遗忘框架,在整个推理过程中实现稳健的隐私保护。具体而言,我们首先通过语义感知检测识别敏感内容;随后通过安全提示前缀注入全局安全约束;接着执行轨迹感知抑制,在整个推理链上动态阻断敏感内容;最后应用token级自适应过滤,在生成时阻止精确与改写形式的敏感token。此外,为克服现有评估协议的不足,我们引入两个指标:Multi-Decoding Consistency Assessment(MCS),衡量跨多样解码策略下遗忘的一致性;Multi-Granularity Membership Inference Attack(MIA)Evaluation,在答案与推理链两个层面量化隐私保护。在R-TOFU基准上的实验表明,STaR以极小的效用损失实现全面且稳定的遗忘,为LRM中的隐私保护推理树立新标准。
