论文

评估指标能检测出文言英译中的错误吗?

Do Evaluation Metrics Detect Errors in Classical Chinese to English Translations?

模型评测评测方法与指标

摘要

尽管 大语言模型 可以很好地翻译一些历史语言,但由于缺乏可靠的评估,它们在数字人文工作流程中的实用性受到限制。我们使用文言到英语的翻译作为测试用例,研究为现代语言开发的现有自动评估指标在这种情况下是否可靠。我们引入了一个基于最小对的诊断框架,捕获学术使用中突出的错误类型,探讨基于参考和无参考的错误敏感性和对有效变化的容忍度的指标。我们发现所有指标都存在盲点,但 MetricX24 总体表现最好。我们的研究结果强调,需要针对历史和文化不同的翻译环境制定更稳健和可解释的指标。