论文
TermJudge:机器翻译评估中的文档级指标判断而非计数术语
TermJudge: A Document-Level Metric Judging, Not Counting, Terminology in Machine Translation Evaluation
摘要
现有的用于评估机器翻译 (MT) 中术语使用的自动指标会惩罚与固定参考的任何偏差,将翻译错误与人工翻译人员通常产生的有效术语变化混为一谈。我们引入了 TermJudge,这是一种文档级术语指标,它为每个术语的出现分配一个可解释的判断:符合术语表的出现被确定性地解决,而分歧则使用完整的文档上下文在两步LLM作为判断程序下进行评估:第一步检测并标记术语错误;第二步检测并标记术语错误。第二个对有效的文档级差异进行排序,避免不一致。根据专家错误注释和文档级人类 MQM 分数进行验证,TermJudge 在系统级和段级元评估中均排名第一,领先于术语表一致性和质量估计基线。当应用于翻译学术文档的八个系统时,在两种提示条件下,我们观察到术语表注入通过消除真正的错误而不是有效的变化来改善所有配对比较中的术语翻译。 TermJudge 作为开源代码发布。