论文
过度拒绝和表示子空间:对齐 LLM 中任务条件拒绝的机制分析
Over-Refusal and Representation Subspaces: A Mechanistic Analysis of Task-Conditioned Refusal in Aligned LLMs
摘要
经过训练以拒绝有害请求的对齐语言模型也表现出过度拒绝:它们拒绝看似类似于有害指令的安全指令。一种自然的方法是消除全局拒绝方向,将隐藏状态向量引向有害拒绝示例,但这只是顺便纠正过度拒绝,同时破坏更广泛的拒绝机制。在这项工作中,我们分析了两种拒绝类型的表征几何,以了解为什么会发生这种情况。我们表明,有害拒绝方向与任务无关,并且可以由单个全局向量捕获,而过度拒绝方向则与任务相关:它们位于良性任务表示集群内,在不同任务之间变化,并跨越更高维度的子空间。线性探测表明,这两种拒绝类型在代表性上与早期的 Transformer 层不同。这些发现为为什么仅靠全局方向消融无法解决过度拒绝提供了机械解释,并证实了针对特定任务的几何干预是必要的。