论文
通过语料库驱动的词汇修剪实现高效的多语言神经机器翻译:英语-阿拉伯语案例研究
Efficient Multilingual Neural Machine Translation via Corpus-Driven Vocabulary Pruning: An English-Arabic Case Study
摘要
采用大型预训练多语言模型进行神经机器翻译(MNMT)面临着重大挑战:由于词汇量和嵌入层过大,导致内存和计算消耗过多。现有的压缩方法如剪枝、量化和知识蒸馏虽然减少了参数冗余,但它们主要保留了原始词汇的结构,从而未能解决效率低下的一个主要根源。我们在本文中提出了一种通用优化框架,它将词汇修剪方法与 MNMT 模型的目标 微调 协议相结合。我们使用三种模型(M2M100、NLLB-200、mBART-50)在英语-阿拉伯语对上评估所提出的框架。我们的方法将词汇量从超过 128,000 个减少到大约 10,000 个标记,从而节省了 60% 的内存,而不会损失任何性能。结果表明,优化的多语言模型可以匹配或超过专用双语基线的性能。特别是,经过修剪和微调的 M2M100 模型获得了 42.04 的竞争性 BLEU 分数(OPUS-MTenar 双语模型为 44.59),同时在 COMET 指标上显着优于 COMET 指标(0.8730 与 0.7911),显示出卓越的语义充分性和流畅性。