论文
先测试,后路由:语言模型如何跨模型和语言执行上下文条件规则
Test, then Route: How Language Models Execute In-Context Conditional Rules Across Models and Languages
摘要
当语言模型遵循上下文条件规则(例如“if P(x) then A else B”)时,它是否会用一个测试谓词的模块和另一个路由答案的模块组装运行时电路?我们在四供体设计下通过激活修补来探究这一点,该设计的两个交换规则供体使条件和答案词不一致,因此每一层都揭示了它携带的两者中的哪一个。在来自两个家族和共享一个固定项目库的六种语言的三个开放模型中,中间堆栈残差带携带谓词的真值:修补它会重新路由答案,谓词结果翻转接近 1.0,映射翻转接近 0.0,在 18 个单元中的 17 个中满足严格的预先指定的隔离标准,并且相同的本地化适用于五个谓词家族。路由器显示相反的配置文件。学习的子空间在训练对中近乎完美地翻转 A 和 B,但在每个模型中以大约 0 的值转移到新的对,而在 Gemma-3-4B(跨语言探测的唯一模型)中,它以大约 0.98 的值转移到其他语言中的同一对。在我们运行的每个探针下,路由器方向都是词元绑定且不可转移的(在 Gemma 中主要是答案读出,在 Qwen 中是特定于对的),而不是抽象路由模块。测试是模块化的;在这些探测下,路线不是。