论文
创造力偏差:机器评估如何与文学翻译中的创造力作斗争
Creativity Bias: How Machine Evaluation Struggles with Creativity in Literary Translations
摘要
本文研究了自动评估指标 (AEM) 和 LLM 法官评估在跨多种语言、体裁和翻译方式的文学翻译中的表现。目的是评估这些工具在评估翻译、创造力(创造性转变和错误)时与专业人士的配合程度,并看看它们是否可以替代费力的手动注释。由经验丰富的专业文学翻译人员创建了跨三种模式(人工翻译、机器翻译和译后编辑)、三种流派和三种语言对的文学翻译数据集,并对其创造力进行了详细注释。结果表明,AEM 和 LLM 作为法官的评估与创造力的专业评估相关性较差,LLM 作为法官表现出有利于机器翻译文本的系统性偏见,并惩罚创造性和文化上适当的解决方案。此外,诗歌等文学体裁的表现始终较差。这凸显了当前文学翻译自动评估工具的根本局限性,以及创建新工具的必要性,这些新工具不会经常将常规翻译视为错误。