论文

人工智能翻译文学文本“不错”,但读者仍然更喜欢人工翻译

AI translation of literary texts is "fine", but readers still prefer human translations

模型评测基准与评测资源

摘要

文学作品的人工智能翻译日益普遍。虽然内容可能被充分呈现,但我们对读者在沉浸感和文学效果方面的体验还不够了解——自动指标或针对流畅性和充分性的人工评估很难捕捉到这些方面。我们要求 15 位热心读者将最近出版的 15 部法语、波兰语和日语小说翻译成英语的人工翻译 (HT) 与使用基于代理语言模型的管道生成的机器翻译 (MT) 进行比较。读者在两种条件下评估大约 8K 字的摘录:沉浸式阅读整个摘录(30 次比较)和仔细阅读 386 个对齐的 HT-MT 块对(772 次比较),每本书有两名读者。总体而言,读者认为 MT“很好”,但更喜欢 HT(在摘录级别上描述性为 19/30,在块级别上显着为 522/772),因为它的轻松、清晰和身临其境的性质。读者的亮点表明,在一本书中,MT 的质量差异比 HT 的质量差异更大。至关重要的是,读者无法可靠地区分两者(17/30 猜对),并且倾向于更喜欢他们认为是人类的版本。自动指标,包括 LLM 作为法官的方法,无法恢复读者的偏好并有利于机器翻译。我们发布了 LAIT(文学人工智能翻译),这是一个以读者为中心的评估数据集,包含 1K 读者评论、2K 判断和偏好评分以及 7.2K 跨度注释,以及我们的评估协议和支持接口。