论文
DeShortcut-Align:解耦虚假快捷方式以实现大型推理模型中的鲁棒安全对齐
DeShortcut-Align: Decoupling Spurious Shortcuts for Robust Safety Alignment in Large Reasoning Models
摘要
通过监督微调(SFT)和强化学习(RL)对大型推理模型(LRM)进行安全调整通常会产生近乎完美的安全分数,但这种明显的成功是以严重的过度拒绝和总体能力下降为代价的。通过系统的实证分析,我们发现这些失败与虚假捷径的学习密切相关,而不是与稳健的意图敏感安全评估密切相关。具体来说,我们确定了两个主要的快捷方式:格式化快捷方式,其中拒绝行为过度绑定到经常出现在安全对齐语料库中的结构提示模板;以及词汇快捷方式,其中敏感关键字会反射性地触发对良性查询的拒绝。为了减轻对这些快捷方式的依赖,我们提出了 DeShortcut-Align,这是一种快捷方式解耦对齐框架,可以减少对表面线索的依赖。 DeShortcut-Align 跨三个协调阶段进行操作:(1)拒绝敏感度归因,它屏蔽输入标记以量化其对最终拒绝响应分布的影响; (2)归因引导对比增强,使用高敏感度标记构建良性对比样本,以减轻词汇捷径; (3) 反事实一致性正则化,通过注意力盲法构建模板消除状态,以强制 SFT 和 RL 之间的决策一致性,从而减轻格式化快捷方式依赖。在 7B 和 14B 模型上的实验表明,DeShortcut-Align 显着提高了针对模板剥离绕过攻击的鲁棒性(降低了高达 72% 的性能下降),大幅减少了超过 58% 的过度拒绝,并更好地保留了通用推理能力,从而减轻了安全训练中常见的对齐负担。