论文
仅仅重复是不够的:因果验证 Gemma 2 和 3 中的多语言 SAE 翻译功能
Recurrence Is Not Enough: Causally Validating Multilingual SAE Translation Features in Gemma 2 and 3
摘要
稀疏自动编码器 (SAE) 特征越来越多地用于解释和引导语言模型行为,但目前尚不清楚在一种语言上下文中发现的特征在处理另一种语言的提示时是否发挥相同的因果作用。我们使用翻译起始特征来研究这个问题(Wu et al., 2026)。我们重现了 Wu 等人的 SAE 特征发现方法。 Gemma 2 中并将其扩展到不同提示语言、源语言和目标语言的多语言设置。然后,我们通过在推理过程中放大或消除其激活来测试跨设置重复出现的特征是否会影响翻译行为。我们还检查了该方法是否可以应用于 Gemma 3。在这两个模型中,我们观察到相同的发现:尽管我们可以找到 20 多个在所有发现设置中频繁激活的特征,但因果验证表明几乎所有特征都具有较小或不一致的效果。相比之下,一项功能——Gemma 2(L10,5717)和 Gemma 3(L20,2456)——在 23 种语言设置中放大时持续提高 COMET 分数,而在 23 种语言设置中消融时则降低 COMET 分数。这些结果表明,特征重现可以夸大跨语言迁移,同时识别 Gemma 2 和 Gemma 3 中与语言无关的翻译起始方向。