论文

减轻大型推理模型中的欺骗性安全对齐

Towards Mitigating Deceptive Safety Alignment in Large Reasoning Models

模型训练强化学习

摘要

大型推理模型 (LRM) 通常使用强化学习 (RL) 进行训练,以在生成最终答案之前改进其思维链 (CoT) 推理的生成。然而,强化学习奖励通常是根据最终答案分配的,对中间推理很少或没有提供直接监督。这可能会导致欺骗性的安全对齐,其中推理轨迹和最终答案传达不一致的安全信号。为了系统地研究这一现象,我们引入了 DSAR(欺骗安全对齐率),这是一种联合评估推理痕迹和最终答案以量化其安全不一致的指标。在多个 LRM 和基准中,我们发现欺骗性安全对齐在标准提示条件下普遍存在,并且在预填充攻击下显着放大。我们进一步提供了隐藏表示分析,表明模型在最终答案阶段比中间推理阶段表现出更强的安全辨别力。为了弥补这一差距,我们提出了 SARA(安全感知推理对齐),这是一种基于强化学习的方法,它奖励安全感知推理和安全的最终答案,鼓励早期有害意图识别并强制推理答案的一致性。实验表明,SARA 显着减轻了标准和对抗环境下的欺骗性安全一致性,同时保留了有用性和实用性。代码可在 https://github.com/xzhou98/SARA. 获取