论文

往返翻译揭示了前沿多语言基准所遗漏的内容

Round-Trip Translation Reveals What Frontier Multilingual Benchmarks Miss

模型评测评测方法与指标

摘要

多语言基准指导前沿模型的开发。然而,前沿模型报告的多语言评估的结构与流行推理和知识基准类似,但跨多种语言。我们展示这样的基准,并因此进行多语言评估,衡量数学推理和事实回忆,而不是多语言熟练程度。例如,在这些基准测试中,思维变体的表现明显优于指令变体,但在现实世界的多语言任务(例如 LMArena)中往往表现较差。我们提出了一个简单的替代方案:通过往返翻译评估多语言能力。给定源语言文本,将其翻译成目标语言并反译;原始内容和结果之间的语义差距暴露了多语言生成能力的失败。往返翻译与 LMArena 上的用户评分和我们的基准几乎完美相关 (\r{ho} = 0.94),不需要人工参考翻译,也不需要比测试模型更有能力的多语言判断。最后,我们引入了 Lost in Translation (LiT),这是一个具有挑战性的往返翻译基准,涵盖全球广泛使用的语言,用于对多语言前沿模型进行现实评估。