论文

专家评分标准:用于翻译错误跨度检测的特定案例 MQM 评分标准

Rubric-as-Experts: Case-Specific MQM Rubrics for Translation Error Span Detection

模型评测评测方法与指标

摘要

大语言模型 (LLM) 已显示出无参考跨级翻译质量估计 (QE) 的潜力,但基于多维质量指标 (MQM) 的现有方法通常依赖于跨翻译实例共享的固定标题配置。然而,翻译实例在错误复杂性、歧义性和所需的评估粒度方面通常存在很大差异,使得静态标题分配对于跨级错误检测来说不是最佳的。我们发现较大的 MQM 子类型空间可以提高错误覆盖率,但也会引入更多误报,而不同的翻译实例更喜欢不同的标题粒度,这表明应为每种情况动态分配评估空间。因此,我们提出了一个针对特定案例的动态标题框架,该框架可以自适应地为各个翻译实例构建 MQM 评估空间。与生成完全自由形式的量规的方法不同,我们的框架仍然以预定义的 MQM 分类法为基础,同时针对不同情况动态选择合适的子类型空间和评估粒度。对机器翻译会议 (WMT) 跨多个模型规模的跨级 QE 基准进行的实验表明,所提出的框架持续改进了 F1 和马修斯相关系数 (MCC)。