论文
用于低资源 NMT 的数据合成和参数高效 微调:Q'eqchi' Mayan 案例研究
Data Synthesis and Parameter-Efficient Fine-Tuning for Low-Resource NMT: A Case Study on Q'eqchi' Mayan
摘要
数字资源匮乏的土著语言的神经机器翻译常常受到数据极度稀缺的阻碍,从而导致对提取式网络抓取的依赖。为了确保数据主权,本研究引入了一种数据合成方法来引导 NMT 模型,而无需抓取目标语言并行文本。我们以 Q'eqchi' Mayan 为重点,通过 LoRA 适配器在基于 mT5 的模型上利用参数高效 微调 (PEFT),将社区来源的词典转换为大型合成语料库。域内评估展示了较高的结构习得能力 (BLEU 42.02),证明综合约束可以有效地教授复杂的凝集形态和 VOS 词序。然而,针对有机术语表的评估揭示了结构语义差距(BLEU 0.59),该模型保持了语法完整性,但缺乏自然语言的词汇基础。该模型表现出对合成模板的约束结构方差的过度拟合;尽管管道中的语义熵很高,但它与自然语言的句法流动性作斗争,迫使有机输入进入严格的学习模式。此外,利用多任务学习架构的消融研究导致了负迁移,这表明辅助任务竞争 LoRA 适配器内有限的参数容量,导致合成标记的过度优化,而牺牲了有机灵活性。最终,我们确定合成引导是一种高效的结构引物,但需要真实的数据通过课程学习进行语义细化。