论文
策略:用于机器翻译的分类感知智能语料库采样
TACTICS: Taxonomy-Aware Intelligent Corpus Sampling for Machine Translation
摘要
大规模机器翻译(MT)系统通常根据语料库中的随机样本进行评估,语料库的分布组成是其组装方式的产物。这样的样本继承了集合碰巧包含的现象,而不是系统必须处理的全部空间,涵盖规则管理的约定(术语、标点符号、货币格式)和上下文相关的现象(语气、敬语、文档级连贯性),因此不为评估稳健性提供覆盖保证。我们提出了 TACTICS(分类学感知覆盖优化智能语料库采样),它将覆盖范围重新定义为明确的目标。 TACTICS 从语言环境风格指南中引入分层分类法,根据它对片段进行分类,并选择一个固定预算子集,共同优化稀有类别的覆盖范围、文档级一致性和对整个语料库的分布保真度。 TACTICS 应用于四个翻译方向的机器翻译评估,通过词汇和基于嵌入的选择提高了罕见类别的覆盖率。通过针对分离系统的现象,TACTICS 使固定评估预算走得更远,从比随机抽样少得多的细分中恢复真实的系统排名,只要存在真正的质量差距,并且从不表明不存在差异的情况。