论文

诊断翻译基准:EU20 基准套件的自动化质量保证研究

Diagnosing Translated Benchmarks: An Automated Quality Assurance Study of the EU20 Benchmark Suite

模型评测基准与评测资源

摘要

机器翻译的基准数据集降低了成本并提供了规模,但噪音、结构损失和质量不均匀会削弱信心。重要的不仅仅是我们是否能够翻译,还在于我们是否能够大规模地衡量和验证翻译的可靠性。我们通过三步自动化质量保证方法研究 EU20 基准套件中的翻译质量,该套件包括翻译成 20 种语言的 5 个既定基准,通过三步自动化质量保证方法:(i) 具有针对性修复的结构语料库审计; (ii) 使用神经度量(COMET、无参考和基于参考)和翻译服务比较(DeepL / ChatGPT / Google)进行质量分析; (iii) 基于 LLM 的跨度级别翻译错误景观。趋势是一致的:COMET 分数较低的数据集在跨度级别上表现出较高的准确性/误译错误比例(特别是 HellaSwag;ARC 相对干净)。 MMLU 上基于参考的 COMET 与人工编辑的样本点的方向相同。我们发布了 EU20 数据集的清理/更正版本以及可重复性代码。总之,自动化质量保证提供了实用的、可扩展的指标,有助于优先审查——补充而不是取代人工参考标准。