论文
通过 词元级 语言无关空间中的最佳传输进行跨语言表示对齐
Cross-Lingual Representation Alignment by Token-Level Optimal Transport in a Language-Agnostic Space
摘要
跨语言对齐(CLA)旨在跨语言对齐大语言模型(LLM)的表示,从而实现跨语言迁移以提高多语言能力。以前的 CLA 方法经常忽略表示中编码的特定于语言的信息,只考虑句子级别的对齐,这可能会导致性能不佳和输入输出语言不匹配。我们提出了 CAROT(通过最佳传输在语言无关空间中表示的跨语言对齐),它由两个步骤组成:识别 LLM 内部状态中的语言特定表示,并通过最佳传输在 词元级 上跨语言对齐语言无关表示,同时显式保留语言特定表示。推理时引导实验表明,CAROT 计算的表示是有效的对齐目标,在保持输入输出语言一致性的同时,将多语言性能提高了 11.2 个百分点。我们进一步使用 CAROT 获得的表示作为训练目标,将对齐的表示内化。经过训练的模型在 18 个评估设置中的 11 个中优于现有的 CLA 方法(3 个模型 $\times$ 3 个任务 $\times$ ID/OOD 语言)。我们的工作为 LLM 中 CLA 的有效对齐目标的构成提供了见解。代码可在 https://github.com/ynklab/CAROT 获取