论文

为什么大语言模型低资源翻译失败?揭开机器翻译 大语言模型 的词元动态

Why do Large Language Models Fail in Low-resource Translation? Unraveling the Token Dynamics of Large Language Models for Machine Translation

模型评测模型行为与机制分析

摘要

大语言模型(LLM)最近在机器翻译(MT)方面表现出了强大的性能。然而,大多数先前的工作侧重于提高翻译质量或对翻译质量进行基准测试,对基于 LLM 的翻译失败的时间和原因提供的了解有限。在这项工作中,我们通过评估 15 个模型(包括四个推理 LLM),跨 22 个具有不同资源级别的语言对 (LP),系统地分析了 MT 中 LLM 的故障模式。我们发现,非以英语为中心的 LP 的 COMET 分数始终低于以英语为中心的对。为了调查根本原因,我们引入了词元激活率(TAR),这是一个衡量模型在生成过程中如何有效地利用其词汇表中特定于语言的词元的指标。我们使用训练数据中具有已知语言分布的模型来验证 TAR 作为语言表示的代理,并表明较低的 TAR 与较差的翻译性能密切相关。此外,推理 LLM 在翻译成低 TAR 语言时往往会生成更多标记,这表明存在补偿机制,尽管它对翻译质量的影响因模型而异。总的来说,我们的研究结果强调了 词元级 动力学对于理解 LLM MT 性能的重要性。