论文
多语言语言模型中语言控制的潜在机制
Latent Mechanisms of Language Control in Multilingual Language Models
摘要
多语言 大语言模型 可能会出现意外的代码切换——在生成过程中不必要地在语言之间进行切换。我们对跨层转码器中识别语言控制潜在的三种方法进行了比较研究:基于激活值的选择(ValSel)、基于激活频率的选择(FreqSel)和LLM生成的基于潜在注释的选择(AnnSel)。为了评估这些方法在识别语言控制潜伏方面的有效性,我们引入了两个多语言基准,它们展示了对七种语言的语言控制进行细粒度分析的语码转换。通过对 Gemma-2-2B 和 Qwen3-4B 进行针对性的干预实验,我们发现这三种方法都有效地操纵了生成语言,其中 FreqSel 实现了最强的整体性能,而 AnnSel 通过显式语言注释提供了可解释的潜在选择。淘汰分析表明,这些方法选择不重叠但功能各异的潜在子集,表明冗余而不是单一的规范语言方向。代码和数据可以在 https://github.com/rm-3284/Latent-Mechanism-Multilingual 找到。