论文

CoPiT:传统文字中低资源蒙古文的认知枢轴翻译

CoPiT: Cognitive Pivot Translation for Digraphic Low-Resource Mongolian in the Traditional Script

应用与实践机器翻译

摘要

资源匮乏的语言对于机器翻译来说仍然具有挑战性,蒙古语就是一个典型案例。作为一种双文字语言,蒙古文以西里尔文字和繁体文字书写,这在数据可用性方面表现出严重的不平衡。虽然西里尔文字资源相对丰富,但传统文字的数据仍然极其稀缺且拼写模糊,导致直接翻译的性能大幅下降。我们提出了 CoPiT,这是一种基于认知动机的基于枢轴的翻译管道,它通过西里尔字母路由翻译来利用这种内部资源层次结构。该管道在翻译前明确解决了传统脚本中由脚本引起的歧义,从而实现更稳定和准确的意义传递。在多个骨干模型和目标语言中,CoPiT 的性能始终优于直接翻译,实现了显着的绝对 BLEU 改进以及一致的 1.5-1.6 倍 COMET 增益。这些成果使得强大的开源模型在可比较的评估设置下能够匹配或超越 GPT-4.1。除了推理时间的改进之外,CoPiT 还可以直接从传统脚本文本构建合成并行数据,从而缓解现实资源匮乏场景中的数据稀缺问题。我们发布了一个新的多文字并行数据集,涵盖两种文字的蒙古语以及英语、韩语和俄语。所有数据集和代码均可在 https://anonymous.4open.science/r/anonymous_project-76C7 上公开获取。