论文

THINKSAFE:面向推理模型的自生成安全对齐

THINKSAFE: Self-Generated Safety Alignment for Reasoning Models

模型训练监督微调与指令调优

摘要

大推理模型 (LRM) 通过在推理任务上利用强化学习 (RL) 来生成长思维链 (CoT) 推理,从而实现卓越的性能。然而,这种过度优化通常会优先考虑合规性,从而使模型容易受到有害提示的影响。为了缓解这种安全性下降,最近的方法依赖于外部教师蒸馏,但这引入了分布差异,从而降低了本地推理能力。我们提出 ThinkSafe,这是一个自行生成的对齐框架,无需外部教师即可恢复安全对齐。我们的主要见解是,虽然合规性会抑制安全机制,但模型通常会保留潜在知识来识别危害。 ThinkSafe 通过轻量级拒绝引导来解锁这一点,指导模型生成分布内安全推理轨迹。对这些自生成的响应进行微调可以有效地重新调整模型,同时最大限度地减少分布变化。 DeepSeek-R1-Distill 和 Qwen3 上的实验表明 ThinkSafe 在保持推理能力的同时显着提高了安全性。值得注意的是,它实现了卓越的安全性和与 GRPO 相当的推理能力,同时显着降低了计算成本。代码、模型和数据集可在 https://github.com/seanie12/ThinkSafe.git 获取。

THINKSAFE:面向推理模型的自生成安全对齐
图1:Qwen3 系列的安全性与推理性能。