论文

诊断,然后修复:用于特定领域机器翻译的两阶段 MQM 引导的译后编辑框架

Diagnose, Then Repair: A Two-Stage MQM-Guided Post-Editing Framework for Domain-Specific Machine Translation

模型推理推理验证与自校正

摘要

基于大语言模型的机器翻译评估可以与人类的判断紧密匹配,但实际上它在很大程度上仍然是诊断性的,在实际生产限制下,信号很少转化为直接的质量改进。我们提出了一个两阶段、评估者引导的自动后期编辑框架,将 MQM 式评估转变为有针对性的修复:检索增强的 LLM 评估器在明确的编辑合同下输出结构化的跨级 MQM 诊断,而单独的 LLM 后期编辑器则对这些诊断进行最少的编辑。与单阶段“判断和细化”基线相比,这种分离提高了可控性并减少了释义漂移。在一项涉及涵盖三个模型提供商和七种语言的七个大语言模型的系统研究中,我们的最佳配置比单阶段后期编辑方法持续提高了 COMET-22 和 COMETKiwi 分数,而评估者的错误范围和严重性与人类 MQM 注释和人类编辑偏好非常一致。