论文
文档级翻译评估的盲目性
The Blindness of Document-Level Translation Evaluation
摘要
文档级机器翻译 (MT) 评估通过向注释者呈现完整文档来扩展段级协议,假设这种呈现会引发文档级判断。我们使用反事实条件(MIX)来测试这个假设,其中每个文档组合来自不同系统的片段,保留文档级表示,同时打破跨片段一致性。在 18,420 个专家英语到韩语注释和 14 个自动指标中,连贯和不连贯的文档之间的分数、系统排名和错误注释在统计上是等效的。感知并不能解释这一点:在显示匹配的段落时,评分者在 87.3% 的试验中将连贯的段落识别为单个译者的作品。文档呈现确实改变了注释器的工作方式,但这种改变不会影响到记录的输出。盲目的是协议,而不是注释者。令人担忧的不是分数低于标准,而是投资于文档级系统、指标和注释的资源可能无法衡量它们想要衡量的内容。