论文
使用语法书籍进行低资源机器翻译合成数据生成的析因研究
A Factorial Study of Synthetic Data Generation for Low-Resource Machine Translation using Grammar Books
摘要
尽管存在描述性语法书籍,但大多数濒临灭绝的语言缺乏机器翻译所需的并行数据。我们引入了一个管道,使用 大语言模型 从语法书中提取语法规则、例句和词典,并为 微调 生成合成并行语料库,而不是像之前的工作那样在推理时将语法内容输入到提示中。在三种类型不同的低资源语言——Kalamang(巴布亚语)、Tuatschin(罗曼语)和 Mandan(苏安语)上进行验证——我们表明,合成数据上的 微调 在 Kalamang 75% 的配置和 Tuatschin 59% 的配置中比种子数据基线有所改进,最佳情况 ChrF++ 增益分别为 +8.8、+5.3 和 +3.3。通过对 96 种配置(不同的目标词性、检索粒度和样本量)进行系统析因研究,我们确定了哪些因素组合推动了收益,以及它们在哪里崩溃。我们的结果表明,静态语言文档可以重新用于机器翻译 微调,为资源严重不足的语言提供翻译工具的实用途径。