论文

自信但错误:针对低资源自动后期编辑的受限解码诊断

Confident but Wrong: A Constrained Decoding Diagnostic for Low-Resource Automatic Post-Editing

模型评测评测方法与指标

摘要

针对低资源语言 (LRL) 的自动后期编辑 (APE) 通常无法改进机器翻译 (MT),仅凭分数无法说明原因:更多训练是否有帮助,或者训练数据是否太不一致而无法学习。我们引入了一种黑盒推理时间诊断,无需重新训练或注释即可区分这两种情况。它改变了编辑距离惩罚$\lambda$,该惩罚驱动模型从自由编辑转向复制机器翻译,并读取两个信号:(1) 翻译编辑率 (TER)-vs-$\lambda$ 曲线的形状,如果模型的编辑减少误差,则为 U 形;如果没有减少误差,则单调递减; (2)对模型置信度的信任程度不断提高的约束变量的排序,这表明置信度是否跟踪编辑质量。在英语-僧伽罗语上的纯解码器和编码器-解码器模型中,诊断暴露了两种与异构编辑后信号一致的故障模式作为根本原因:二进制崩溃(模型复制 MT 或进行脱靶编辑)和置信错误校准(我们测试的置信信号没有将有用的编辑与不必要的编辑区分开)。该模式适用于英语-马拉地语和英语-泰米尔语,故障模式跟踪编辑后分布,而不是机器翻译质量或语言系列。除了诊断之外,曲线形状还为从业者指明了具体的下一步;在有利的情况下,静态约束会产生免费的推理时间精度增益。我们发布了第一个英语-僧伽罗语 (~66k) 和一个新的英语-泰米尔语 (~39k) APE 数据集以及所有代码。