论文

强化目标语言特征:基于 SAE 的多语言推理指导

Strengthening Target-Language Features: SAE-Based Steering for Multilingual Inference

模型推理解码与生成控制

摘要

多语言 大语言模型 在不同语言之间表现出巨大的性能差异,而现有的适应方法通常需要参数更新和大量的多语言训练数据。我们提出了一种推理时多语言引导方法,该方法使用预训练的稀疏自动编码器来识别和增强目标语言相关的特征。使用多语言并行句子,我们比较跨语言的 SAE 激活,并选择与每种目标语言相关的少量特定于层的特征。这些特征被解码为转向信号并注入到模型的隐藏状态中,无需额外的训练。使用 Gemma-3-12B-it 进行的实验表明,XCOPA 上的平均准确度提高了 10.9 个百分点,XNLI 上平均准确度提高了 5.3 个百分点,MGSM 上平均准确度提高了 1.9 个百分点。