论文

相似性贯穿始终:LLM的多语言泛化依赖于语言级相似性结构

Similarity All The Way Up: Multilingual Generalization in LLMs Relies on Language-Level Similarity Structures

模型评测模型行为与机制分析

摘要

随着大语言模型(LLM)在多样任务上能力增强,其泛化(或不泛化)的能力仍难以量化,且在有限领域之外鲜被理解。尤其是,众所周知LLM难以向英语之外、且在其训练数据中语料匮乏的语言进行多语言泛化。为理解个中缘由以及为何某些模型表现更佳,我们借鉴认知科学领域的悠久研究传统,主张成功的泛化源于相似空间中的恰当表征。我们考察LLM的表征在多大程度上捕捉了不同语言之间的层级相似性结构。引人注目的是,我们发现LLM的潜在表征大体上重现了印欧语系谱系树的层级结构——在表征空间中将同一语族的语言紧密聚在一起。此外,我们发现模型反映语言相似性结构的程度与其在多语言自然语言推理基准XNLI上的表现相关。这一工作将相似性驱动泛化的经典研究拓展到大规模场景,表明以相似方式表征相似语言的模型能更好地从一种语言泛化到另一种语言。

相似性贯穿始终:LLM的多语言泛化依赖于语言级相似性结构:论文配图
图 1:LLM 隐式恢复语言之间的关系:38 种印欧语言之间的相似性结构,源自 XLM-Roberta 的表示(左)并根据 Heggarty 等人重建。 (2023)(右)。颜色代表系统发育语言亚科,右上角有一个图例。