论文

更深推理会损害对齐吗?推理模型的对齐退化与缓解

Does Deeper Reasoning Compromise Alignment? Revealing and Mitigating of Alignment Collapse in Large Reasoning Models

模型评测安全与风险评测

摘要

思想链(CoT)的出现为大型推理模型(LRM)奠定了坚实的基础。虽然深度推理被广泛认为可以增强安全对齐,但扩展推理下对齐机制的稳定性仍未得到充分探索。本文通过揭示一个严重漏洞挑战了主流观点:深度推理可能导致对齐崩溃。为了严格量化这种现象,我们提出了对齐丢失率(ALR)指标。我们的实验表明,随着推理深度的增加,ALR 显着上升,表明模型针对外部扰动的鲁棒性严重下降。利用这种不稳定性,提出了一种新颖的越狱范式:推理陷阱(RT)。 RT将模型引入扩展推理,放大对抗性攻击的影响,导致安全能力急剧下降。为了阐明这种崩溃背后的机制,我们将注意力稀释视为根本原因,这是由于扩展推理过程和原始输入之间对注意力的竞争而产生的。为了缓解这种情况,推理残差对齐(RRA)是一种轻量级防御策略,它通过与推理过程集成的残差连接动态地重新强调输入。