论文
自适应显式安全:触发大型推理模型中的潜在安全意识
Adaptive and Explicit safe: Triggering Latent Safety Awareness in Large Reasoning Models
摘要
虽然大型推理模型(LRM)擅长复杂任务——但它们对复杂越狱与直接有害查询仍高度脆弱。为解决该脆弱性——先前工作严重依赖外部人工数据标注做安全对齐。但我们观察到:当把原始查询连同其自身推理轨迹重新呈现给LRM时——LRM能内在识别安全风险——我们把该能力称为潜在安全意识。为利用该安全意识——我们首先用监督微调(SFT)显式诱导安全标签——在不安全查询的初始推理内容之后触发安全分析与引导——同时对一般查询保留标准响应以确保自适应触发。随后——我们应用直接偏好优化(DPO)进一步增强安全分析与引导的正确性与稳定性。值得注意的是——两个训练阶段所需的响应完全由被优化模型自己生成。经(安全触发)SFT与DPO——实验结果显示显著安全增强。例如——DeepSeek-R1-Distill-Llama-8B的攻击成功率(ASR)在有害与越狱基准上平均分别下降24.65%与36.72%。最后——我们的安全触发方法对通用性能与用户体验几乎没有负面影响。
