论文

具有交互式区域和语域选择的上下文感知阿拉伯语方言机器翻译

Context-Aware Dialectal Arabic Machine Translation with Interactive Region and Register Selection

应用与实践机器翻译

摘要

当前的阿拉伯语机器翻译 (MT) 系统常常难以解释方言多样性,经常将方言输入同质化为现代标准阿拉伯语 (MSA),并且用户对目标方言的控制有限。在这项工作中,我们为阿拉伯语方言机器翻译提出了一个上下文感知且可操纵的框架,该框架明确地模拟了区域和社会语言变异。我们的主要技术贡献是基于规则的数据增强(RBDA)管道,它将 3,000 个句子的种子语料库扩展为一个平衡的 57,000 个句子的并行数据集,涵盖八个区域品种,例如埃及、黎凡特、海湾等。通过 微调 一个以轻量级元数据标签为条件的基于 mT5 的模型,我们的方法可以在翻译输出中实现跨方言和社会语域的可控生成。通过自动评估和定性分析的结合,我们观察到明显的准确性与保真度权衡:诸如 NLLB(不遗漏任何语言)之类的高资源基线通过默认 MSA 平均值实现了更高的 BLEU 总分 (13.75),同时表现出有限的方言特异性。相比之下,我们的模型获得了较低的 BLEU 分数 (8.19),但产生的输出与预期的区域品种更加一致。支持定性评估,包括 LLM 辅助的文化真实性分析,表明与基线系统相比,方言一致性有所改善(4.80/5 与 1.0/5)。这些发现凸显了标准机器翻译指标对于方言敏感任务的局限性,并激发了对更好地反映阿拉伯语机器翻译语言多样性的评估实践的需求。