论文

M-GATE:大语言模型 的多语言语法、翻译准确性和效率基准

M-GATE: Multilingual Grammar, Accuracy in Translation, and Efficiency Benchmark for Large Language Models

模型评测基准与评测资源

摘要

多语言语言模型部署在一百种或更多语言中,但大多数基准测试测试模型是否可以用某种语言执行任务,而不是测试该模型是否命令该语言本身,从而将流畅性与熟练程度混为一谈。我们推出 M-GATE(多语言语法、翻译准确性和效率),这是一个语言能力基准,涵盖从高资源到低资源的 30 种不同类型的语言。 M-GATE 包括三个任务:对语言学家精心设计的、对抗性选择的句子进行语法错误检测,这些句子会打开困难的、特定于语言的现象;跨 29 种目标语言的共享英语源的往返翻译,由三个提供商 LLM 评审小组打分,并与专业注释者进行验证;以及补充标记器效率措施。我们评估了 50 多个型号的 80 多种配置。流畅度和熟练度之间存在巨大差异:能够胜任翻译的模型在对抗性语法项目上几乎没有机会,最好的模型马修斯相关系数 (MCC) 仅 0.36,而它们的错误系统地倾向于低标记、接受不语法文本而不是发出错误警报。翻译质量密切跟踪语言在预训练数据中的份额(相对于 Log Common Crawl 份额,r = 0.86),产生急剧的低资源惩罚,但随着连续的模型发布,这种惩罚正在缩小。启用推理可靠地改进了翻译,而其对错误检测的影响较小,并且对于某些模型是负面的,因此最佳配置取决于任务。为了防止污染,测试项目在不断更新的公共排行榜后面保持私密,并发布了说明性示例 (https://m-gate.ai)。