论文

超越复制:评估文学翻译中 LLM 理解力和创造力的配对任务框架

Beyond Reproduction: A Paired-Task Framework for Assessing LLM Comprehension and Creativity in Literary Translation

模型评测评测方法与指标

摘要

大语言模型 (LLM) 越来越多地用于文学翻译等创造性任务。然而,翻译创造力仍未得到充分探索,也很少进行大规模评估,而源文本理解通常是孤立研究的,尽管事实上,在专业翻译中,理解和创造力紧密相连。我们通过应用于 11 本书的文学摘录的配对任务框架来解决这些差距。任务 1 评估源文本的理解,任务 2 通过创造性潜力单位 (UCP) 评估翻译创造力,例如隐喻和双关语。我们使用将专家人工注释与基于 UCP 的自动评分相结合的可扩展评估设置,对 23 个模型和 4 个以创造力为导向的提示进行基准测试。我们的研究结果表明,强大的理解力并不能转化为人类水平的创造力:模型经常产生字面或上下文不恰当的渲染,对于距离较远的英汉语言对来说,差距特别大。以创造力为导向的提示只能带来适度的收益,并且只有一种模型(Mistral-Large)接近人类水平的创造力(0.167 vs. 0.246)。在所有模型提示组合中,只有三个组合的创造力得分超过 0.1,而其余的则保持为零或接近零。