论文
PseudoRef:在缺少人工参考译文时构建机器翻译评测参考
In the Blind: Building Pseudo-References for MT Evaluation
摘要
WMT26 通用 MT 任务评估没有人类参考的 10 种语言对的系统(既不是从头开始翻译,也不是根据人类的 MT 输出进行后期编辑)。我们描述了如何为这些语言对和其他六种语言对(其中可以使用某些形式的人类参考)构建伪参考:七个模型在最多五个提示条件下翻译 3,277 份官方文档,总共给出 26 种系统提示组合;然后三个无参考质量估计(QE)模型对每个候选者进行评分;每个文档的选择器会选择一个翻译,GPT-5.5 会在需要时进行后期编辑。在没有参考文献的情况下工作暴露了量化宽松引导选择的失败模式:指标将错误语言的流畅输出排在正确翻译之上。在分数融合中添加置信度缩放的语言识别惩罚会将错误语言计数降至零,并且生成的选择器在 MetricX 上的得分仍然高于其所取代的排名融合基线。由于在构建这些对时没有可用的参考资料,因此我们根据去年的 WMT25 人类判断来校准每个选择决策。构建后发布的人工评估显示了选择错误的成本:当选择器保留前沿模型候选时,我们的参考与最强的参与系统保持一致,而当选择器不保留前沿模型候选时,我们的参考会比它们低 17 个 ESA 点。我们发布了每个参考文献的选择方法和出处(https://github.com/surrey-nlp/PseudoRef)