论文

通过跨语言传输和 LoRA 适配器合并实现低资源阿拉伯文字语言的生物医学机器翻译

Biomedical Machine Translation for Low-Resource Arabic-Script Languages via Cross-Lingual Transfer and LoRA Adapter Merging

模型优化模型合并

摘要

我们提出了一项医疗保健领域跨语言迁移的系统研究,以解决阿拉伯文字语言生物医学 NMT 资源的稀缺问题。我们使用阿拉伯语和波斯语作为更高资源的支点来改进 \textbf{四个资源严重不足}目标的翻译:达里语(阿富汗波斯语,波斯语的标准化变体)、普什图语、索拉尼库尔德语(中央库尔德语,库尔德语的主要标准化变体)和乌尔都语(与印地语密切相关)。在小型解码器 LLM 上使用 LoRA 微调,我们训练 \textit{特定于域的枢轴适配器}并评估 \textbf{三种传输策略}:少样本上下文学习、最小监督适应,以及据我们所知,首次在此设置中零数据 LoRA 适配器合并。仅用 500 个句子的监督适应即可实现达里语 (CHrF++ 41.01) 接近枢轴语言的质量,并为乌尔都语 (28.88) 带来有意义的收益,而适配器合并以零额外成本达到达里语监督适应的 3.5 CHrF++ 以内。普什图语和索拉尼库尔德语仍然不足以进行高风险的临床部署,当结构与支点的距离太大时,就会暴露出跨语言迁移的局限性。 LoRA 适配器合并对于密切相关的语言效果出人意料地好,即使没有目标语言生物医学数据。