论文

IndicQE-APE:印度语言质量评估和自动后期编辑的综合基准

IndicQE-APE: A Consolidated Benchmark for Quality Estimation and Automatic Post-Editing for Indic Languages

模型评测基准与评测资源

摘要

印度语质量估计 (QE) 和自动后期编辑 (APE) 数据分布在不同的版本中,因此没有单一资源能够同时支持跨任务和语言对的训练和评估。我们将 WMT 2020-2024 共享任务谱系与扩展的英语-马拉雅拉姆语资源整合到 IndicQE-APE 中:9 个方向对上的 126{,}754$ 实例,同一段上最多对齐四种标签类型,直接评估,人工后期编辑,单词级标签和错误解释,以及在四个难度轴上分层的测试集。我们对段级 QE 上的六个提示 LLM 和三个 COMET 指标以及 APE 上的三个系统进行了基准测试。其中两个轴部分是根据直接评估定义的,并选择其中的压缩切片。段级和 词元级 信号不一致的段的排名低于同一语言的同等评分的段。每个模型的四次提示成本为 3.4 美元或以下,相关性和输出格式合规性均如此。未经编辑的 MT 击败了我们在四对中的三对上运行的所有 APE 系统。基准测试 (https://huggingface.co/datasets/surrey-nlp/IndicQE-APE) 和代码 (https://github.com/surrey-nlp/IndicQE-APE) 已发布。