论文
大语言模型 中的文化感知机器翻译:基准测试和调查
Culture-Aware Machine Translation in Large Language Models: Benchmarking and Investigation
摘要
大语言模型(LLM)在通用机器翻译方面取得了强劲的表现,但其在文化感知场景中的能力仍然知之甚少。为了弥补这一差距,我们引入了 CanMT,一种用于机器翻译的文化感知小说驱动并行数据集,以及用于评估文化翻译质量的有理论基础的多维评估框架。利用 CanMT,我们在不同翻译策略约束下系统地评估了各种 LLM 和翻译系统。我们的研究结果揭示了模型之间巨大的性能差异,并证明翻译策略对模型行为产生系统性影响。进一步的分析表明,不同类型的特定文化项目的翻译难度各不相同,并且模型对特定文化知识的识别与在翻译输出中正确操作该知识的能力之间仍然存在持续的差距。此外,在《LLM-as-a-judge》中,纳入参考翻译可以显着提高评估可靠性,强调了它们在评估文化意识翻译质量中的重要作用。语料库和代码可在 CanMT 上获取。