论文

国际语假设:LLM 通过潜在任务不可知的特征空间进行翻译

The Interlingua Hypothesis: LLMs Translate via a Latent Task-agnostic Feature Space

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 最近展示了在强监督基线上改进的机器翻译性能。这就提出了 LLM 如何在语言之间执行机器翻译的机制是什么的问题。受最近的可解释性发现的启发,即 LLM 使用大量多语言潜在特征表示来执行语言建模,我们提出了国际语假设。该假设认为,语言模型通过将源句子读取到潜在特征空间中进行翻译,并通过从潜在特征空间中读取来生成目标句子。我们展示了三条证据来支持这一假设:(1)跨语言对的 BLEU 差异在很大程度上可以通过特定于语言的能力来预测,而没有特定于语言对的交互项; (2)许多模型组件在单语任务和翻译任务中都有因果影响; (3) 相对于对齐文档上的 微调,单语言数据上的 微调 恢复了很大一部分翻译改进。这些共同提供了支持国际语假设的聚合证据,并提出了理解和改进如何利用 LLM 执行翻译任务的新方法。