论文
推理结构对推理模型的安全对齐至关重要
Reasoning Structure Matters for Safety Alignment of Reasoning Models
摘要
大型推理模型(LRM)在复杂推理任务上表现强劲,却常常对恶意用户查询生成有害响应。本文探究这些安全风险的深层原因,并指出问题出在推理结构本身。基于这一洞见,我们主张通过改变推理结构即可实现有效的安全对齐。我们提出AltTrain,一种简单而有效的后训练方法,能显式改变LRM的推理结构。AltTrain既实用又具泛化性,无需复杂的强化学习(RL)训练或奖励设计,仅需用轻量的1K训练样本做监督微调(SFT)。跨LRM骨干与模型规模的实验表明,其安全对齐效果显著,并在推理、问答、摘要及多语言设置中保持稳健泛化。
