论文

LLM拒答中的对称破缺:答案释放比拒答恢复更局部

Broken Symmetry in LLM Refusal: Answer Release Is More Local Than Refusal Restoration

模型评测模型行为与机制分析

摘要

当语言模型拒绝对某个提示作答时,我们不清楚正确答案是已从其内部表示中被抹除,还是仅在输出层被抑制。我们用一个受控的扣留作答设置来研究这一机制,该设置为双向激活修补产生了完美匹配的作答与拒答轨迹。我们在匹配的因果干预下发现了干预局部性上的因果不对称,我们称之为对称破缺。即使模型生成了一段干净的拒答,正确答案仍可从其隐藏状态中被线性恢复。此外,释放这个被扣留的答案是一个高度局部的操作,只需要单位置的修补。相反,反向操作并非同等局部:重新施加抑制需要在多个位置进行更广泛的干预,而拼装一段连贯的拒答序列则更加困难。我们进一步证明,虽然一个平均的答案到拒答位移向量标记了这些状态之间的几何差异,但它并不能充当在两种行为之间可靠、可逆的线性控制开关。综合来看,我们的发现表明拒答并不像一个简单的对称开关那样运作。对安全与审计而言,这意味着探针可恢复性可能高估真实的行为控制力,而定位拒答相关方向并不能可靠地赋予把模型从作答转向连贯拒答的能力。

LLM拒答中的对称破缺:答案释放比拒答恢复更局部:论文配图
图6:干净目标恢复(clean-target recovery)的匹配局部性画像。单元格显示单位置修补下的末位 token top-1 恢复情况。与 IOI、GSM8K-MC(Cobbe 等,2021)和强制覆盖不同,withhold refusal 在位置 −2 仍保留后层的槽外支持,并在位置 −3 留下非零足迹。