论文
神经象形文字翻译中的数据污染:再现性研究
Data Contamination in Neural Hieroglyphic Translation: A Reproducibility Study
摘要
古老且濒临灭绝的语言对自然语言处理提出了独特的挑战:它们的数据集本质上是稀缺的、难以扩展的,并且是根据公式化的语料库构建的——使得数据质量问题尤其严重,但很少经过审计。出于了解当前 NMT 对于此类语言可以实际实现的目标的动机,我们研究了象形文字到德语的翻译,最近的一项研究报告使用微调的 M2M-100 实现了 61.5 BLEU。我们的复制品在发布的模型中仅产生 37.0 BLEU。通过调查这一差距,我们发现 2% 的测试目标在训练中表现相同(16/50;在 70% 阈值下,8 克重叠下为 50%)。这种污染使分数急剧膨胀:在跨越两种架构的五种模型配置中,受污染的样本达到了高达 83.8 BLEU / 0.924 COMET-22,而干净样本的得分为 30.9--39.2 BLEU / 0.622--0.676 COMET-22。文档级去污仅将受污染的 BLEU 降低了 4.6 个点,因为 8/16 目标通过其他源文档持续存在——需要目标级重复数据删除。我们发布了经过净化的 34 个样本测试集,并建立了校正基线 (30.9--39.2 BLEU),为这种濒临灭绝的书写系统提供了 NMT 能力的现实评估。