论文
FTB Graph:多语模型首 token 语言身份电路
FTB Graph: Determining and Validating First-token Broadcasters and Language-Identity Head Circuits in Multilingual Language Models
摘要
在多语言环境中运行的大型语言模型必须在生成的早期解决目标响应语言,但管理第一个词元语言身份决策的因果电路仍然没有很好地映射。我们对涵盖四个系列的六种模型架构进行了端到端结构电路分析:GPT-2、BLOOM-560M、Pythia-1B/2.8B 和 Qwen2.5-1.5B Base/Instruct。使用具有 FP16 主动钳位的边缘归因修补(EAP),然后使用 2,000 个候选边缘搜索上限进行精确激活修补验证,我们提取驱动第一词元语言广播的有向非循环图。在独立模型中,我们观察到深度或中深度广播中心,尽管 Pythia-2.8B 和 BLOOM-560M 的证据最强,因为 GPT-2 和 Pythia-1B 留下了很少的图外头用于比较,而 Qwen2.5-1.5B 变体都颠倒了必要性检查。从 Pythia-1B 扩展到 2.8B 扩大了节点参与,同时保持类似的经过验证的边缘预算,从而产生更稀疏的拓扑。 Qwen2.5-1.5B 基础电路和指令电路保留了 84.7% 的 Jaccard 相似性,包括第 27 层集线器,这表明第一个词元路由很大程度上是在预训练期间建立的,并通过指令调整来保留。最后,EAP 分数与大多数模型中的精确修补增量相关性较弱,这表明线性梯度近似可能与 FP16 中的因果干预有所不同,并激励精确修补验证以实现可靠的电路发现。
