论文
弥合语言差距:预训练 和数据集中的跨语言映射,以增强多语言 LLM 性能
Bridging Linguistic Gaps: Cross-Lingual Mapping in Pre-Training and Dataset for Enhanced Multilingual LLM Performance
摘要
由于高资源语言和低资源语言之间的数据不平衡,以及 预训练 中的单语言偏差,多语言 大语言模型 (LLM) 在处理跨语言任务时遇到了困难。现有的方法,例如双语 微调 和对比对齐,可以提高跨语言性能,但它们通常需要大量并行数据或不稳定。为了应对这些挑战,我们在 预训练 阶段引入了跨语言映射任务,该任务在不影响单语流利性的情况下增强了跨语言对齐。我们的方法在 LLM 嵌入空间内双向映射语言,从而提高语言生成和理解。我们进一步提出了一种语言对齐系数,即使在数据有限的情况下,也可以稳健地量化跨语言一致性。机器翻译(MT)、跨语言自然语言理解(CLNLU)和跨语言问答(CLQA)的实验结果表明,我们的模型在 MT 中实现了高达 11.9 BLEU 点的增益,在 CLQA BERTScore-Precision 中实现了 6.72 点的增益,并且在强多语言基线上 CLNLU 准确率提高了超过 5%。这些发现凸显了将跨语言目标纳入 预训练 中以改进多语言 LLM 的潜力。