论文

对齐路径如何:本地化、扩展和控制语言模型中的策略电路

How Alignment Routes: Localizing, Scaling, and Controlling Policy Circuits in Language Models

模型评测模型行为与机制分析

摘要

我们将策略路由机制本地化在对齐训练的语言模型中。中间层注意力门读取检测到的内容并触发更深的放大器头,将信号增强到拒绝。在较小的型号中,门和放大器是单头的;在更大的范围内,它们变成了跨越相邻层的头部带。门对输出 DLA 的贡献不到 1%,但互换测试 (p < 0.001) 和敲除级联证实它是因果必要的。 n >= 120 的交换筛选在来自 6 个实验室(2B 至 72B)的 12 个模型中检测到相同的基序,尽管具体的头部因实验室而异。每头消融在 72B 处减弱达 58 倍,并且错过了互换识别的门;在规模上,交换是唯一可靠的审计。调制检测层信号持续控制从硬拒绝到逃避再到事实回答的策略。在安全提示上,同样的干预将拒绝变成有害的指导,这表明经过安全训练的能力是通过路由来控制的,而不是被删除。阈值因主题和输入语言而异,并且即使行为基准没有变化,电路也会在家庭内的几代人之间重新定位。路由是早期承诺:在更深的层完成处理输入之前,门在其自己的层触发。在三种模型中,上下文替换密码将门交换的必要性降低了 70% 至 99%,并且模型切换为解决难题而不是拒绝。将明文门激活注入密码前向传递可恢复 Phi-4-mini 中 48% 的拒绝,将旁路定位到路由接口。第二种方法是密码对比分析,它使用明文/密码 DLA 差异来映射 O(3n) 次前向传递中的完整密码敏感路由电路。任何失败检测层模式匹配的编码都会绕过该策略,无论更深的层是否重建内容。