论文
Self-Guard:通过增强自我反思防御大推理模型
Self-Guard: Defending Large Reasoning Models via enhanced self-reflection
摘要
大型推理模型(LRM)的出现带来了显式推理的新范式,取得显著进展,但也带来推理操纵与信息泄露等独特风险。为缓解这些风险,当前对齐策略主要依赖繁重的后训练范式或外部干预。然而这些方法往往计算开销大,且无法解决内在的觉知—顺从鸿沟:一种关键错位,模型能识别潜在风险,却因谄媚倾向而优先遵从用户指令。针对这些局限,我们提出 Self-Guard,一个在表征层面强化安全顺从的轻量级安全防御框架。Self-Guard 通过两个主要阶段运作:(1) 安全导向提示,激活模型潜在的安全意识以引发自发反思;(2) 安全激活引导,提取隐状态空间中由此产生的方向偏移并加以放大,确保推理期间安全顺从压过谄媚。实验表明,Self-Guard 有效弥合了觉知—顺从鸿沟,在不损害模型效用的前提下取得稳健的安全表现。此外,Self-Guard 在多样的未见风险与不同模型规模上表现出强泛化,为 LRM 安全对齐提供了低成本的解决方案。
