论文

话语依赖:翻译难度的连续标准

Discourse Dependency: A Continuous Criterion for Translation Difficulty

模型评测评测方法与指标

摘要

最近对更严格的机器翻译基准的呼吁并没有阐明困难的含义。我们认为,一个有意义且目前未测量的轴是参考范围,即一个片段必须回顾其文档以解析其包含的实体和代词的距离。我们将其形式化为话语依赖(DDP),这是一种根据命名实体重新提及和代词共指计算得出的无度量的源端度量。根据人工标准共指进行验证,DDP 在 99.2% 的细分中出现单方面错误,因此高 DDP 细分被证明需要远程上下文。将 DDP 应用于 WMT24++ 和 WMT25 表明,两者都严重偏向低 DDP 段,而域标签无法区分这些段。在 DDP 的基础上,我们比较了英语-韩语后期编辑设置中的五种上下文注入策略,以及不同的上下文大小和选择。随着 DDP 的发展,没有任何策略可以跟上人工后期编辑的步伐。对于 DDP >= 15 的细分,评分者更喜欢人工翻译,而自动指标则没有差异。随着前沿系统的总得分饱和,DDP 将评估从模型得分的好坏转变为模型能够达到的程度。