论文

在思维链(CoT)生成前促进安全决策迈向更安全的大推理模型

Towards Safer Large Reasoning Models by Promoting Safety Decision-Making before Chain-of-Thought Generation

模型训练监督微调与指令调优

摘要

大型推理模型(LRM)借助思维链(CoT)取得了卓越性能,但近期研究表明,这种增强的推理能力是以安全能力的显著退化为代价的。本文揭示,LRM的安全退化仅在CoT启用之后出现,而在CoT禁用时并未观察到这种退化。这一观察促使我们考虑鼓励LRM在CoT生成之前做出安全决策。为此,我们提出一种新颖的安全对齐方法,促使LRM在开始CoT生成之前进行安全决策。具体而言,我们首先利用基于BERT的分类器从安全模型(例如禁用CoT的LRM)中提取安全决策信号,然后将这些信号作为辅助监督整合进LRM的安全对齐。这样,安全梯度便可反向传播到LRM的潜在表示,有效增强LRM在CoT生成面前的安全决策能力。大量实验表明,我们的方法在有效保持LRM通用推理性能的同时,显著提升了其安全能力。

在思维链(CoT)生成前促进安全决策迈向更安全的大型推理模型:论文配图
图 3:我们方法的总体框架。 (1)提取安全决策信号。我们首先将更安全的教师模型的安全决策能力提取到基于 Bert 的分类器中。该分类器封装了教师的二元安全策略。 (2) 安全决策信号的调整。这个过程通过训练模型的潜在表示来提升 LRM 的安全决策能力。 (3)推理阶段。经过训练的模型实现了更强的安全决策能力。它倾向于在为有害查询(路径 A)生成 CoT 之前拒绝,同时保留对良性请求的完整推理能力(路径 B)。