论文
HardMTBench:知识密集型领域的汉英翻译压力测试
HardMTBench: Stress-Testing Chinese-English Translation on Knowledge-Intensive Domains
摘要
FLORES-200 等通用机器翻译基准测试在汉英对上已达到饱和状态,其中现代 大语言模型 聚集在一个狭窄的高分区间内。在22个系统中,FLORES-200 zh-en GEMBA得分在7.87分范围内,标准差为2.29,压缩了金融、医疗、法律、科技等知识密集型领域系统之间的差距。我们推出 HardMTBench,这是一种用于双向中英文域翻译的难度感知诊断基准。 HardMTBench 涵盖 12 个领域,包含 10,000 个手工策划的源句子和参考翻译,打包为 20,000 个定向测试项目。三阶段构建流程构建了 84{,}566 对的域平衡候选池,对知识密度、翻译难度、术语负载和参考正确性应用基于 LLM 的多信号判断,并在具有每个域配额的硬度融合规则下组装最终测试集。在涵盖通用 LLM、商业引擎和专用 MT 模型的 22 个系统中,HardMTBench 将跨系统 GEMBA 范围比 FLORES-200 扩大了大约两倍,引起可见的排名重新排序,并暴露了仅质量指标往往会扁平化的特定领域术语和知识弱点。所有数据和代码均在 https://github.com/jasonNLP/HardMTBench 上开源。