论文

DEPART:分解多语言模型性能差异的来源

DEPART: DEcomposing PARiTy across Multilingual LLMs

模型评测模型能力评测

摘要

多语言 大语言模型 (mLLM) 排行榜报告每种语言的准确性,但很少解释为什么会出现差异,从而导致系统性偏见无法归因,并且无法为从业者提供可操作的杠杆。我们首先通过无分布的 Friedman 和 Kruskal-Wallis 检验确定这些差距是系统性的,而不是采样噪声的产物,然后引入一个两步贝叶斯分层框架,将多语言性能方差分解为可解释的组件。首先,隔离归因于语言身份的方差,我们表明可观察的语言特征(文字系统、语系和类型学距离)解释了理解任务上的 $R^2_{\text{ling}} = 79\%$ 的方差和推理上的 $92\%$ 的方差,模型与英语的内部表征相似性成为两类任务中的主要预测因子。其次,分解完整的 (model$\times$benchmark$\times$language) 立方体,我们发现 NLU 和推理具有根本不同的方差分布:模型身份主导理解(方差 $66.7\%$),而基准$\times$模型交互主导推理($46.3\%$)。这些结果共同将多语言评估从被动的绩效映射重塑为可解释的诊断框架,并具有针对语言差异的根本驱动因素的具体杠杆。