论文

拒绝几何反映了拒绝训练:不同的拒绝前缀可以提高稳定的排名并削弱拒绝向量消融攻击

Refusal geometry reflects refusal training: diverse refusal prefixes can raise stable rank and weaken refusal vector ablation attacks

模型评测模型行为与机制分析

摘要

拒绝训练通过训练模型拒绝不安全查询,降低误用风险,从而保护 AI 模型免遭越狱。最近的研究发现,对齐语言模型中的拒绝行为可以通过单个激活方向或跨有害提示共享的低维拒绝子空间来调节:消除这些方向会抑制拒绝,同时在很大程度上保留其他模型功能。然而,目前尚不清楚为什么各种模型中的安全关键特征会出现在集中的低维结构中。在 OLMo-2-0425-1B-Instruct 的案例研究中,我们发现拒绝几何反映了拒绝训练:拒绝完成第一词元损失导致的激活更新解释了由此产生的拒绝方向和拒绝子空间。我们通过拒绝数据集的训练动态来研究拒绝方向,并揭示它们的脆性与重复的拒绝开始有关,而重复的拒绝开始又与低维子空间中的梯度集中和拒绝特征有关。通过冻结模型分析和受控合成 微调,我们发现了强化杠杆的证据:不同的拒绝开始可以提高梯度和激活变化的稳定等级,使得拒绝更难通过矢量消融攻击来消除。