论文
经验证把安全理解内化进大推理模型
Internalizing Safety Understanding in Large Reasoning Models via Verification
摘要
虽然显式思维链 (CoT) 支持大型推理模型 (LRM),但它可以生成风险更高的最终答案。当前的对齐范例主要依赖于外部强制的合规性,优化模型来检测恶意提示,而不是评估其自身输出的安全性。我们认为,这种方法在很大程度上仍然是行为性的:我们的实证分析表明,表面上一致的模型缺乏内在的安全理解,往往无法验证自己的响应安全性,并且仍然容易受到对抗性越狱的影响。为了解决这一根本限制,我们提出了安全内部(SInternal),这是一个框架,通过专门训练 LRM 进行安全验证任务,使用专家推理轨迹来批评自己生成的答案,从而将安全规范内部化。我们证明,学习验证可以增强响应安全性,从而显着增强针对域外越狱的鲁棒性。此外,当与强化学习相结合时,与标准监督微调相比,SInternal 可以提供更优越的初始化,这表明内化安全理解为对齐创建了比仅仅模仿安全行为更强大的基础。我们的代码可在 https://github.com/AlphaLab-USTC/SInternal 获取
