论文

机器翻译质量能带您走多远?目标导向设置中的外在话语评估

How Far Can Machine Translation Quality Take You? Extrinsic Discourse Evaluation in Goal-Oriented Setups

模型评测评测方法与指标

摘要

现有的机器翻译(MT)指标和以话语为中心的评估主要从本质上评估翻译质量,而不衡量翻译错误的下游后果。在这项工作中,我们重点研究两种不同机制下机器翻译的外在话语评估:静态和交互式。在静态机制下,我们提出了一个实体计数任务作为话语中指称一致性的探索。我们表明,高内在 MT 质量并不能可靠地预测下游话语的成功,并且强大的 MT 系统仍然会产生引用不一致。对于互动机制,我们研究了目标导向的多主体福利外交博弈,作为长期沟通与协调的探索。我们发现特定于交互的翻译失败会影响下游协调。我们的结果强调以目标为导向的环境是对话敏感的外在机器翻译评估的可行框架。