论文

自适应显式安全:触发大型推理模型中的潜在安全意识

Adaptive and Explicit safe: Triggering Latent Safety Awareness in Large Reasoning Models

模型训练监督微调与指令调优

摘要

虽然大型推理模型(LRM)擅长复杂任务——但它们对复杂越狱与直接有害查询仍高度脆弱。为解决该脆弱性——先前工作严重依赖外部人工数据标注做安全对齐。但我们观察到:当把原始查询连同其自身推理轨迹重新呈现给LRM时——LRM能内在识别安全风险——我们把该能力称为潜在安全意识。为利用该安全意识——我们首先用监督微调(SFT)显式诱导安全标签——在不安全查询的初始推理内容之后触发安全分析与引导——同时对一般查询保留标准响应以确保自适应触发。随后——我们应用直接偏好优化(DPO)进一步增强安全分析与引导的正确性与稳定性。值得注意的是——两个训练阶段所需的响应完全由被优化模型自己生成。经(安全触发)SFT与DPO——实验结果显示显著安全增强。例如——DeepSeek-R1-Distill-Llama-8B的攻击成功率(ASR)在有害与越狱基准上平均分别下降24.65%与36.72%。最后——我们的安全触发方法对通用性能与用户体验几乎没有负面影响。

自适应显式安全:触发大型推理模型中的潜在安全意识:论文配图
图 2:我们的安全触发方法概述。两阶段过程激活并增强了模型的潜在安全意识。 (a) 安全触发 SFT:该模型经过一般查询、有害查询和越狱查询的训练,以自适应地引出结构化触发机制 (<safe>),该机制提供安全风险分析和响应生成指导。 (b) 安全触发 DPO:该模型通过优化自行生成的偏好对来完善其安全辨别能力。这些对源自越狱查询,并使用我们的奖励函数(等式 10)进行排名。