论文

最后的翻译基准

Last Translation Benchmark

模型评测基准与评测资源

摘要

为了科学进步,我们需要测试最先进模型极限的基准,以及告诉我们失败案例的评估方法。随着模型变得越来越强大,机器翻译的标准基准正在接近饱和。此外,自动翻译指标不可靠,容易受到 奖励作弊 的影响,并且提供无法操作的评估。即使是人工评估金标准也不是没有问题的,因为它往往缺乏可重复性、客观性和可扩展性。总体而言,这使我们无法跟踪该领域的客观进展并确定改进途径。我们推出了 Last Translation Benchmark,这是一组由人类创作和同行评审的示例(文本、图像、音频、视频),这些示例打破了领先的机器翻译模型。我们还提出了一种新的评估方法:每个示例都带有手工制作的验证规则,描述该示例的具体失败案例,因此允许可靠且可操作的未来评估。最后的翻译基准是一个实时数据集,接受持续的贡献。最新版本是 LTBv1,包含 2026 年 9 月 1 日之前已接受的贡献,随着不断收集新数据,计划未来发布。