论文

使用 Dwadash 基准语料库进行孟加拉语统一多方言神经机器翻译

Unified Multi-Dialectal Neural Machine Translation for Bangla Using the Dwadash Benchmark Corpus

应用与实践机器翻译

摘要

神经机器翻译 (NMT) 和 大语言模型 (LLM) 擅长跨语言任务,但往往无法捕获语言内的形态变化,从而边缘化方言使用者。在孟加拉语中,现有的翻译框架通常依赖标准孟加拉语口语 (SCB) 作为中间支点,这可能会加剧错误并减少跨方言的细微差别。为了解决这一差距,我们引入了一个统一的、多向的 NMT 系统,用于在 SCB 和 11 个区域变体之间进行直接翻译。我们首先回顾之前的方言 NLP 资源,以确定现有的技术差距。作为一项基础性贡献,我们通过整合七个先前数据集和经过母语人士验证的手动增强,构建并发布了孟加拉语大型多方言平行语料库,其中包含 14,562 个对齐行和 51,541 个非空句子对。使用该语料库,我们通过参数高效的权重分解低秩适应(DoRA)对最先进的序列到序列架构进行基准测试。结果表明,对于这项任务,深度单语 预训练 比大量多语言能力更有效。紧凑型 BanglaT5 模型的性能优于 NLLB-200 和 mBART-50,最高可达 13.96 BLEU,达到 29.26 BLEU、57.26 chrF++ 和 49.68 METEOR。数据集扩展研究显示,超过 3,000 个并行对时,收益递减,并表明与标准孟加拉语的语言接近度对于翻译质量而言比原始数据量更重要。最后,我们将优化的模型部署为 INT8 量化的 Web 应用程序,为包容性语言技术和公平的数字访问提供可扩展的开源框架。