论文

校正印度语言翻译评测中 COMET 的脚本偏差

Making COMET Comparable Across Scripts: Diagnosis and Correction of Tokeniser-Induced Script Bias in Indic MT Evaluation

模型评测评测方法与指标

摘要

COMET 将翻译质量报告为单个数字,并且会定期对以不同文字编写的目标语言进行比较。这种比较假设脚本不变性:分数不应取决于承载目标的书写系统。我们通过将目标重新编码为拉丁文字,在 IndicMT Eval 上进行测试,这会改变正字法形式,同时保持内容和人类评分固定。脚本同一性占本机脚本 COMET 方差的 22.9%,并且在所有研究的五种语言中,与注释者的一致性均下降。我们追踪标记器的影响,并使用三种无标签诊断来测量它。这种偏见是两个错误,而不是一个。不同脚本的分数占据不兼容的范围,并且在单个脚本内,度量对翻译的排序不太准确。分数的保序变换无法修复第二个错误。第一个被 COMET-QN 准确删除,它将每个(语言、脚本)对的分数分布映射到共享参考上。与注释者的汇总一致性从 0.300 上升到 0.399,这使得来自不同脚本的分数可以安全地放置在一个轴上,并且每个语言内的顺序都被证明保留。奇偶校验特征的回归器又恢复了 17.1% 损失的灵敏度。其余部分属于编码器,任何后处理都无法到达它。因此,我们建议发布标准化分数、三个诊断以及计算它们所依据的分词器的身份,以便读者可以知道分数在多大程度上反映了翻译质量以及在多大程度上反映了书写系统。

校正印度语言翻译评测中 COMET 的脚本偏差:论文原图
图 1:COMET-QN 跨越 10 个(语言、文字)单元格(框:中位数、IQR、第 5-95 个百分位数;$6{,}995$ 段工作集)。左图,原始 COMET(意思是 $|$per-lang.gap$|=8.14$ 点;汇集的 $\rho_{S}=0.300$):本地细胞,填充,始终位于其罗马化对应部分之上,开放,其边缘因语言而异,对于 MAR 则相反,这是问题 P1(第 6.1 节)。右图,在 COMET-QN 之后(等式 3;均值 $|$per-lang.gap$|=0.00$ pts;池化 $\rho_{S}=0.399$):所有单元格共享池化本机引用,因此通过构造,间隙恰好为零,跨脚本比较变得有意义。在相同的单元格上,池化 Pearson 一致性从 $0.324$ 上升到 $0.400$,而语言内一致性则保持为小数点后四位,GUJ 前后均为 $0.5903$。单元内排序被证明未受影响(等式 2)。