论文
大规模多语言神经机器翻译的注意力下降:发现、分析和缓解
Attention Sinks in Massively Multilingual Neural Machine Translation:Discovery, Analysis, and Mitigation
摘要
神经机器翻译(NMT)中的交叉注意力模式被广泛用于研究多语言模型如何对齐语言结构。我们报告了 NLLB-200 (600M) 交叉注意力分析中的系统工件:非内容标记(主要是序列结束标记、语言标签和标点符号)捕获了总交叉注意力质量的 83% 到 91%。我们将这些称为“注意力池”,将 LLM [Xiao 等人,2023] 的发现扩展到 NMT 交叉注意力,并确定植根于词汇设计而不是位置偏差的因果机制。此伪影导致原始指标低估了近一半的内容级别相似性(原始数据为 36.7%,过滤数据为 70.7%),从而导致未经校正的分析变得不可靠。为了解决这个问题,我们验证了一种仅内容过滤方法,该方法可以删除非内容词元并重新规范化分布。将其应用于非洲语言(斯瓦希里语、基库尤语、索马里语、罗语)和非非洲基准(德语、土耳其语、中文、印地语)的 1,000 个平行句子,我们确认该工件是通用的,并恢复了掩盖的语言信号:教师强迫和生成模式之间存在 16.9 个百分点的差距,注意力熵中清晰的语言家族聚类,以及将 SOV 词序与单调对齐联系起来的隐藏索马里悖论。我们发布了过滤工具包和更正的数据集,以支持多语言 NMT 的可重复解释性研究。