论文

多语言GSM-Symbolic:什么决定跨语言能力迁移

Multilingual GSM-Symbolic: What determines capability transfer across languages?

模型评测鲁棒性、公平性与可信度评测

摘要

我们对一种语言中获得的能力如何迁移到另一种语言、什么支配这种迁移知之甚少:评估依赖不可比、易饱和的数据集,很少联合考察其决定因素。识别预测迁移的因素可避免跨所有语言对的穷举评估,并让开发者瞄准限制低资源语言表现的因素。为评估跨语言能力迁移,我们提出多语言GSM-Symbolic:可扩展的多语言数学数据集,覆盖15种语言的30000个条目匹配问答对;利用符号模板从单样本生成数百万高质量变化以防止过拟合并确保泛化。用其量化能力的最大决定因素:模型规模(β=1.77)、语言资源水平(β=0.77)、推理(β=0.67)与类型学距离(β=-0.25);联合估计允许这些决定因素互相表达:马拉地语评估的32B模型表现得像英语的10B模型。发现对开发者有重要含义:模型规模与推理收窄低/高资源语言的性能差距(β分别为-0.27与-0.20),而类似杠杆对类型学上遥远的语言几乎无效。总体上分析框架解释语言间方差的92%,但仅解释模型×语言方差的23%;对未见语言的预测在6.0pp内(r=.96),纳入目标语言仅10个模板的测量可降至4.19pp——以很少或没有下游数据集即可合理估计性能。