论文

通过安全方向惩罚缓解推理诱导失对齐

Mitigating Reasoning-Induced Misalignment via Safety-Direction Penalty

模型训练监督微调与指令调优

摘要

推理诱导失对齐(Reasoning-Induced Misalignment)是指:在与有害内容无关的推理数据(包括数学、代码以及带思维链的解题数据)上微调,即可诱发大语言模型的有害行为,这对LLM推理的安全性构成严重挑战。跨架构、跨规模、跨数据集的检验表明,RIM并不总是出现。以往工作将RIM归因于神经元层面的纠缠,但既未识别出这种纠缠背后的表征空间几何结构,也未提出训练时的修复方法。我们两方面都做到了:对RIM的表征空间分析,以及安全方向惩罚(SDP)——在推理微调期间惩罚沿学习到的安全方向的移动。该分析提取了激活空间中的两个方向,一个编码推理能力,另一个编码安全行为。这两个方向是耦合的:提升推理能力的微调会移动安全表征,且位移越大的提示表现出越大的安全退化。CKA距离比率与探针定位出与该位移最相关的安全决策层。这些发现指导了SDP的设计:耦合性促使我们惩罚沿安全方向的位移,层定位设定了初始范围。当初始范围在被惩罚层之外留下补偿性位移时,同样的诊断方法指导迭代扩展。在Qwen2.5-3B和7B上,SDP在保持基准推理性能的同时恢复了安全性。