论文
将跨语言迁移中的语言相关性与任务对齐分开
Disentangling Linguistic Relatedness from Task Alignment in Cross-Lingual Transfer
摘要
我们研究了 微调 七个 大语言模型(4B--671B 参数)在阿拉伯语上的跨语言迁移,并评估了闪米特语言和非闪米特对照的零样本阅读理解。在密集和专家混合架构中,我们没有发现闪米特特定迁移的证据:具有弱基线的模型在所有语言中都有显着改善,而强基线模型仅显示出边际收益,无论语言家族如何。思想链消融强化了这一发现——从 微调 中受益最多的相同模型同样从推理时间推理中受益,这表明这两种机制都解决任务格式对齐而不是跨语言知识转移。