论文
通过高资源语言特征迁移增强低资源语言推理
Enhancing Low-Resource Language Reasoning via High-Resource Language Feature Transfer
摘要
即使在解决语义等效的任务时,大语言模型 也会在不同语言之间表现出巨大的性能差异。现有的分析通常将这种现象视为由预训练数据、标记化或基准覆盖范围的差异引起的观察差异。我们研究了一个补充假设:高资源语言(HRL)可能更可靠地引发对特定任务(即数学)推理有用的潜在计算,而低资源语言(LRL)尽管表达相同的任务,但可能会激活这些计算。为了检验这一假设,我们引入了一种机械干预框架,用于跨语言识别和转移与任务相关的稀疏潜在特征。在残差流激活上使用稀疏自动编码器,我们隔离了在成功的 HRL 特定任务推理中丰富的特征,同时过滤掉源语言和通用生成特征。然后,我们根据这些特征构建转向方向,并在 LRL 推理期间注入它们。由此产生的干预措施测试所选特征是否在功能上涉及观察到的推理差距:抑制它们应该损害源语言推理,而激活它们应该部分恢复超出随机和非任务控制的目标语言推理。我们的框架将一些跨语言推理差距重新定义为机制引发的失败而不是能力的缺失,并提供了一种因果可测试的途径来进行特征介导的转移,而无需翻译,微调,或更改面向用户的语言。