论文
测试人类和机器翻译中的去文字化假设
Testing the Deliteralization Hypothesis in Human and Machine Translation
摘要
最近从专用 NMT 系统到通用 LLM 的转变重塑了机器翻译,据报道 LLM 比其前身产生更流畅、更少字面量的输出。我们测试这种转变是否延伸到去字面化假说,翻译研究中长期存在的主张是,翻译在起草和修订时会逐渐变得不那么字面化。使用 WMT24++ 数据集,我们将人工翻译和后期编辑的字面性与两个 NMT 系统和 6 个 LLM 的字面性进行比较,涉及 54 个语言对和三个任务:直接翻译、迭代自我修订和人工草稿的后期编辑。文字性是通过由六种启发式构建的经过验证的综合文字性指数来衡量的。我们发现 (i) 人工翻译的字面量仍然明显低于所有测试的机器翻译系统,尽管最近的 LLM 缩小了差距; (ii) 当提示迭代修改自己的输出时,LLM 单调去文字化,提供第一个证据,证明该假设本身适用于 LLM 生成; (iii) 作为译后编辑,LLM 反转人类译后编辑的修订触发器,容忍字面草稿并针对惯用的人类表述进行修订。