论文

LLM 中的翻译不对称作为数据增强因子:6 种罗曼什语变体的案例研究

Translation Asymmetry in LLMs as a Data Augmentation Factor: A Case Study for 6 Romansh Language Varieties

应用与实践机器翻译

摘要

最近的低资源机器翻译策略依赖于 LLM 来生成基于高资源语言文本的合成数据。我们在罗曼什语中重新审视这个想法,罗曼什语是一种有 6 个不同变体的语言。 LLM 在翻译成罗曼什语时往往会混淆这些变体,但它们非常擅长将罗曼什语翻译成德语等高资源语言。由于这种不对称性,数据增强的方向是一个至关重要的选择。我们发现,与最近的策略相反,创建更高资源语言的合成翻译是更好的方法,只有这种方法才能使我们在德语-罗马什语翻译上超越 Gemini 3 Pro 基线(在资源最低的品种中比 Gemini 多 23 BLEU)。人类评估证实,我们的实验产生了第一个模型,可以在各个罗曼什语品种中生成流畅的翻译。