论文
我们应该对机器翻译中的推理错误抱有迂腐的态度吗?
Should We be Pedantic About Reasoning Errors in Machine Translation?
摘要
在多种语言配对(英语 $\to$ \{西班牙语、法语、德语、普通话、日语、乌尔都语、粤语\})中,我们发现翻译中的推理错误。为了量化这些推理错误发生的频率,我们利用自动注释协议进行推理评估,其中目标是检测推理步骤是否属于以下三个错误类别中的任何一个:(1)源句子未对齐,(2)模型假设未对齐,或(3)推理轨迹未对齐。我们使用一系列从弱到强的干预措施,用扰动痕迹来纠正这些已识别的推理错误:对冲、移除、移除后重新推理、事后诸葛亮和预言机干预。对推理痕迹进行干预的实验表明,对推理进行小的修正对翻译质量影响不大,但更强的干预会产生最高的解决率,尽管翻译质量的收益参差不齐。我们最终发现,机器翻译中的推理错误在乌尔都语中可以高精度识别,但在西班牙语中精度较低,但消除这些推理错误并不能显着解决初始错误,这表明机器翻译的推理 忠实性 有限。