论文

LangFIR:从单语言数据中发现稀疏语言特定特征以进行语言引导

LangFIR: Discovering Sparse Language-Specific Features from Monolingual Data for Language Steering

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 显示出强大的多语言能力,但可靠地控制其输出的语言仍然很困难。表示级引导通过在推理时将特定于语言的向量添加到模型激活来解决这个问题,但识别残差流中特定于语言的方向通常依赖于获取成本高昂的多语言或并行数据。稀疏自动编码器 (SAE) 将残差激活分解为可解释的稀疏特征方向,并为此搜索提供自然基础,但现有的基于 SAE 的方法面临相同的数据约束。我们引入了 LangFIR(通过随机词元过滤进行语言特征识别),这是一种仅使用少量单语言数据和随机词元序列来发现特定于语言的 SAE 特征的方法。许多由目标语言输入一致激活的 SAE 功能不会对语言标识进行编码。随机标记序列呈现这些与语言无关的特征,允许 LangFIR 过滤掉它们并隔离一组稀疏的特定于语言的特征。我们表明,这些特征极其稀疏,对其目标语言具有高度选择性,并且具有因果重要性:定向消融仅增加相应语言的交叉熵损失。利用这些功能为多语言生成控制任务构建引导向量,LangFIR 在三个模型(Gemma 3 1B、Gemma 3 4B 和 Llama 3.1 8B)、三个数据集和 12 种目标语言的引导方法中实现了最佳平均精度 x BLEU,性能比最强的单语言基线高出 4.7 倍,并超越了使用并行数据的方法。我们的结果表明,多语言 LLM 中的语言身份位于可通过单语言数据发现的稀疏特征方向集中。代码可在 https://github.com/JaMussCraft/LangFIR 获取