论文

语言平等是有代价的:EU-24+ 多轮 LLM 性能的系统调查

Language Equality has a Price: A Systematic Investigation of Multi-turn LLM Performance for EU-24+

智能体系统Agent任务评测

摘要

我们将 大语言模型 (LLM) 评估为语言智能体,在 30 种语言的自我游戏中玩目标导向的对话游戏:24 种欧盟官方语言加上其他 6 种语言。与静态或基于偏好的评估不同,这种范例是多回合、无参考和以编程方式评分的,并且由于游戏机制与语言无关,因此它通过本地化一组固定的提示和单词列表文件来扩展到新语言。通过评估 9 个开放权重和商业 LLM,我们发现没有一个开放权重模型能够很好地覆盖 EU-24:在每种官方语言中,两个商业系统的得分都超过了每个开放权重模型,而整个 EU-24 中两个最弱的平均值低于 40 分。即使在公共网络文本少四个数量级的语言中,商业系统也保持领先,这表明语言平等是可以实现的,但仅靠公共爬行是无法实现的。一个模型的家乡地区提升了它,但没有缩小差距:对于两个中国开发的模型来说,中文是所有 30 种语言中最强的,但所有模型中最好的中文分数属于美国商业系统。覆盖范围也不是平等的服务。综合模型和语言来看,非英语语言的运行成本中位数比英语高 31%,但得分低 10%。