论文

并行数据在学习共享多语言表示方面的效用有限

On the limited utility of parallel data for learning shared multilingual representations

模型评测模型行为与机制分析

摘要

共享多语言表示对于跨语言任务和跨语言知识迁移至关重要。这项研究着眼于并行数据(即翻译的句子)在预训练中的影响,作为触发跨语言对齐表示的信号。我们用不同比例的并行数据训练参考模型,结果表明并行数据似乎对跨语言对齐的影响很小。基于多种评估方法,我们发现效果仅限于在预训练的早期阶段加速表示共享,并减少模型中特定于语言的神经元的数量。即使没有来自并行数据的明确信号,跨语言对齐似乎也会出现在相似的水平上。