论文

Self-Guard:通过增强自我反思防御大推理模型

Self-Guard: Defending Large Reasoning Models via enhanced self-reflection

模型推理解码与生成控制

摘要

大型推理模型(LRM)的出现带来了显式推理的新范式,取得显著进展,但也带来推理操纵与信息泄露等独特风险。为缓解这些风险,当前对齐策略主要依赖繁重的后训练范式或外部干预。然而这些方法往往计算开销大,且无法解决内在的觉知—顺从鸿沟:一种关键错位,模型能识别潜在风险,却因谄媚倾向而优先遵从用户指令。针对这些局限,我们提出 Self-Guard,一个在表征层面强化安全顺从的轻量级安全防御框架。Self-Guard 通过两个主要阶段运作:(1) 安全导向提示,激活模型潜在的安全意识以引发自发反思;(2) 安全激活引导,提取隐状态空间中由此产生的方向偏移并加以放大,确保推理期间安全顺从压过谄媚。实验表明,Self-Guard 有效弥合了觉知—顺从鸿沟,在不损害模型效用的前提下取得稳健的安全表现。此外,Self-Guard 在多样的未见风险与不同模型规模上表现出强泛化,为 LRM 安全对齐提供了低成本的解决方案。

Self-Guard:通过增强自我反思防御大型推理模型
图1:Self-Guard 概览。𝒢 通过两次相继的潜在干预为目标 LRM ℛ 构建安全对齐:(1) 面向安全的提示(𝒢_prompt),其中 𝒢 用面向安全的指令 s 增广输入查询 x_i,诱导隐藏状态 𝐡(x_i) 移向面向安全的状态 𝐡′(x_i)=𝐡(x_i⊕s);(2) 安全激活转向(𝒢_steer),其中该潜在移位被提取为转向向量 𝐯_safety 并注入 𝐡′(x_i),以强化 ℛ 的安全意识,得到最终对齐的隐藏状态 𝐡″(x_i)=𝐡′(x_i)+λ·𝐯_safety。