论文

IFMTBench:多语言翻译教学的综合基准

IFMTBench: A Comprehensive Benchmark for Multilingual Translation Instruction Following

模型评测基准与评测资源

摘要

现代翻译工作流程需要的不仅仅是语义对等。用户通常需要模型保留 JSON 或 HTML 模式、遵循精选的术语表、消除所提供上下文的歧义并匹配指定的寄存器(通常是同时匹配多个寄存器)。 BLEU 和 xCOMET 等传统指标捕获语义保真度,但在约束遵守情况上提供的信号很少,而遵循基准的一般指令则忽略了翻译的跨语言性质。我们引入 \bench,这是一个多语言翻译教学基准,涵盖七种语言,包含 4,506 个单约束和 2,838 个多约束项目,跨越六个约束维度和五种组合模式,并以所有七种语言发布指令。约束被分为由确定性检查器验证的门控子集和由基于标题的 LLM 判断器评分的连续子集,并在抵抗 奖励作弊 的乘法规则下组合。评估 15 个模型揭示了先前协议所忽略的系统性差距:指令遵循的规模比翻译质量更明显,术语表和结构化格式限制主导了难度梯度,而一般指令遵循的排名与翻译行为的相关性很弱。我们的基准测试可在 https://github.com/Tencent-Hunyuan/Hy-MT2/tree/main/IFMTBench 获取。