论文
从检测到拒绝:通过电路引导重量缩放更安全的 LLM
From Detection to Refusal: Safer LLMs via Circuit-Guided Weight Scaling
摘要
尽管进行了广泛的协调工作,大语言模型(LLM)仍然容易在对抗性提示下生成不安全内容,但实施安全行为的内部机制仍然知之甚少。我们从机械可解释性的角度研究 LLM 安全性,并描述了组织拒绝行为的多级*安全电路*,包括 (i) $\textbf{有害检测头}$ 响应有害输入,(ii) $\textbf{安全神经元}$ 调解和稳定残余流中的安全信号,以及 (iii) $\textbf{拒绝头}$ 将这些信号转换为安全响应的生成。使用有针对性的注意头和神经元水平干预措施,我们提供了与该电路组织一致的因果证据,表明抑制上游有害检测头会破坏下游拒绝行为,并且安全神经元介导这种相互作用。我们验证了这种分解在多个 LLM 架构和对抗性攻击设置中重复出现,并使用简单的、保留架构的权重缩放作为机械探针来测试其功能相关性。在六个 LLM 中,电路引导扩展将攻击下的安全率提高了 26.5%,而在四个标准基准测试中,准确度仅下降了 1.7%。总体而言,我们的结果支持对 LLM 安全性的电路级解释,并表明机械抽象可以揭示一致行为背后的稳定且可转移的模式。