论文
阿拉伯语-俄语机器翻译基准:丰富词法和低词汇重叠下微调 NMT 和少样本 LLM 的比较
Benchmarking Arabic--Russian Machine Translation: A Comparison of Fine-tuned NMT and Few-shot LLMs under Rich Morphology and Low Lexical Overlap
摘要
由于阿拉伯语形态丰富且两种语言之间的词汇重叠度较低,阿拉伯语-俄语机器翻译 (MT) 仍未得到充分探索。我们在新的 1547 万对语料库的 20k/5k/5k 分割上,将七个微调神经机器翻译 (NMT) 模型与四个小样本大型语言模型 (LLM) 进行基准测试。经过微调的 NLLB-1.3B 实现了最高的 BLEU (16.3) 和 COMET (0.738)。 Aya-Expanse 8B 在少数 LLM 中领先(500 个句子的 BLEU 1.7,chrF 25.7),但所有 LLM 分数仍远低于微调的 NMT 基线。错误分析将低词汇重叠确定为主要故障模式;在最差的翻译中,mT5-small 产生了 32% 的太短输出。 Bootstrap 测试证实了大多数模型之间存在显着差异。我们的结果表明,在资源匮乏的条件下,经过微调的 NMT 在阿拉伯语-俄语翻译方面显着优于小样本 LLM。