论文
上游决定、下游写入:定位并定价多语言MoE的跨语言拒答回路
Decided Upstream, Written Late: Locating and Pricing the Cross-Lingual Refusal Circuit of a Multilingual MoE
摘要
多语言模型的安全对齐是不均衡的:一个在英语中可靠拒绝有害请求的模型,在低资源语言中往往会对同一请求表示顺从。我们在sarvam——一个印度语系多语言专家混合(MoE)推理模型——中从机制上追溯这一差距,发现它并非未能检测到危害。危害被编码为一个在网络中部近乎语言无关的内部方向(L11处英语与印度语系的余弦相似度约0.9),并且在上游引导该方向可因果地控制拒答。但检测方向与真正"写入"拒答的变化是正交的,后者发生得晚,是在生成过程中逐步组装的,而非在单次前向传播中读取。我们将该写入归因于一个特定、可定位的回路——一个受注意力"对抗者"(opposer)牵制的专家混合"写入者"(writer)——并为每一种干预方式定价:阻尼对抗者廉价且有效;放大写入者面临成本高墙;对相关注意头的精细手术编辑则毫无作用。该回路的组织方式以及暴露它的梯度方法,在第二个无关的MoE模型中同样出现,而该杠杆的强度则依赖于具体架构。最终成果是一张带成本度量的地图,标明多语言安全修复可以落在哪里,以及代价是什么。
