论文
校正印度语言翻译评测中 COMET 的脚本偏差
Making COMET Comparable Across Scripts: Diagnosis and Correction of Tokeniser-Induced Script Bias in Indic MT Evaluation
摘要
COMET 将翻译质量报告为单个数字,并且会定期对以不同文字编写的目标语言进行比较。这种比较假设脚本不变性:分数不应取决于承载目标的书写系统。我们通过将目标重新编码为拉丁文字,在 IndicMT Eval 上进行测试,这会改变正字法形式,同时保持内容和人类评分固定。脚本同一性占本机脚本 COMET 方差的 22.9%,并且在所有研究的五种语言中,与注释者的一致性均下降。我们追踪标记器的影响,并使用三种无标签诊断来测量它。这种偏见是两个错误,而不是一个。不同脚本的分数占据不兼容的范围,并且在单个脚本内,度量对翻译的排序不太准确。分数的保序变换无法修复第二个错误。第一个被 COMET-QN 准确删除,它将每个(语言、脚本)对的分数分布映射到共享参考上。与注释者的汇总一致性从 0.300 上升到 0.399,这使得来自不同脚本的分数可以安全地放置在一个轴上,并且每个语言内的顺序都被证明保留。奇偶校验特征的回归器又恢复了 17.1% 损失的灵敏度。其余部分属于编码器,任何后处理都无法到达它。因此,我们建议发布标准化分数、三个诊断以及计算它们所依据的分词器的身份,以便读者可以知道分数在多大程度上反映了翻译质量以及在多大程度上反映了书写系统。
