论文
使用几何不变稀疏自动编码器发现 LLM 中的跨语言推理不变性
Discovering Cross-Language Reasoning Invariance in LLMs with Geometry-Invariant Sparse Autoencoders
摘要
多语言语言模型可以用不同的语言解决相同的数学问题,但目前尚不清楚它们是否依赖于共享特征或仅产生相似输出的特定于语言的计算。我们使用多语言小学数学 (MGSM) 数据集在来自四个家庭的五个模型中研究这个问题,用英语、德语、法语、西班牙语、俄语和中文解决问题,保留所有六种语言中有效推理轨迹的问题,并通过模型重播这些轨迹以记录多层表示。对于每个模型,我们首先使用居中内核对齐(CKA)来识别具有跨语言对齐的层。在每个选定的层,我们训练两个稀疏自动编码器(SAE):一个仅基线重建模型和本工作中引入的对比变体,即几何不变 SAE(GI-SAE)。 GI-SAE 通过信息噪声对比估计 (InfoNCE) 损失来补充重建损失,该损失训练编码器为同一问题的痕迹产生类似的激活,无论语言或标记位置如何。然后,我们通过在模型前向传播期间在语言之间交换它们的值并测量由此产生的输出变化(通过每个特征的 Kullback-Leibler (KL) 散度进行量化)来测试所得到的共享特征在功能上是否可以互换。尽管 GI-SAE 几乎在每一层都产生更高的 CKA 和 Jaccard 相似性,但更高的几何相似性并不总是意味着更大的功能互换性。我们发现,在此示例中,跨语言特征共享依赖于模型和架构,并且在不同模型中出现在不同的深度。 GI-SAE 主要放大了已经存在的跨语言结构:该模式是特定于模型的,在 Qwen 中得到加强,在 Gemma 中没有功能优势,在 Llama 和 Phi 中混合依赖于层的效果。