论文
评估大语言模型中语言差异对多语言语言能力的影响
Assessing the Impact of Language Disparity on Multilingual Linguistic Ability in Large Language Models
摘要
关于多语言语言模型的语法能力的说法因能力的测量方式而异,但评估范式、后训练和语言资源可用性之间的相互作用尚未得到系统的检验。我们使用四种评估方法在 MultiBLiMP(涵盖 101 种语言的句法最小对基准)上评估来自 6 个系列的基础模型和后训练模型。我们报告了三个主要发现。首先,后训练会降低语法能力,但这种影响的程度会随着模型规模的不同而不均匀地降低,而低资源语言的成本最高。其次,后训练的模型保留了它们无法通过明确提示表达的语法知识,但这只能在高资源语言中进行测量,因为低资源环境中的接近随机水平的基线几乎不留下可被隐藏的知识。第三,母语提示恢复了低资源语言上原本隐藏的能力,这表明只有高资源语言才能从无提示的概率中直接探测。我们的结论是,多语言语法评估必须采用考虑语言特点的多范式协议,以避免系统地低估低资源能力。