论文
在大推理模型中通过基于分布的精炼缓解安全税
Mitigating Safety Tax via Distribution-Grounded Refinement in Large Reasoning Models
摘要
安全对齐会带来安全税(safety tax),扰动大推理模型(LRM)的通用推理能力。现有用于LRM安全对齐的数据集,通常通过从外部LRM或人工标注者蒸馏安全推理轨迹与答案来构建。然而,这些推理轨迹与答案和需要对齐的目标LRM之间存在分布差距,我们推测这种分布差距正是导致目标LRM推理能力显著退化的罪魁祸首。基于这一假设,我们提出一种名为DGR的安全对齐数据集构建方法。DGR将现有的分布外安全推理数据集进行转换与精炼,使其与目标LLM的内部分布对齐。实验结果表明:i) 与Vanilla SFT相比,DGR在所有基线上都有效缓解了安全税并保持安全性能,即平均推理准确率在DirectRefusal上提升+30.2%、在R1-ACT上提升+21.2%;ii) 推理退化程度与分布偏移程度相关,说明弥合这一差距是保持能力的核心。此外,我们发现LRM中的安全对齐可能主要作为激活潜在知识的机制,因为仅需10个样本就足以激活有效的拒绝行为。这些发现不仅强调分布一致性的重要性,也为推理模型中安全的激活机制提供了洞见。
