论文
在思维链(CoT)生成前促进安全决策迈向更安全的大推理模型
Towards Safer Large Reasoning Models by Promoting Safety Decision-Making before Chain-of-Thought Generation
摘要
大型推理模型(LRM)借助思维链(CoT)取得了卓越性能,但近期研究表明,这种增强的推理能力是以安全能力的显著退化为代价的。本文揭示,LRM的安全退化仅在CoT启用之后出现,而在CoT禁用时并未观察到这种退化。这一观察促使我们考虑鼓励LRM在CoT生成之前做出安全决策。为此,我们提出一种新颖的安全对齐方法,促使LRM在开始CoT生成之前进行安全决策。具体而言,我们首先利用基于BERT的分类器从安全模型(例如禁用CoT的LRM)中提取安全决策信号,然后将这些信号作为辅助监督整合进LRM的安全对齐。这样,安全梯度便可反向传播到LRM的潜在表示,有效增强LRM在CoT生成面前的安全决策能力。大量实验表明,我们的方法在有效保持LRM通用推理性能的同时,显著提升了其安全能力。
