论文

多语言视觉语言编码器在哪些方面会在低资源语言上失败?

Where Do Multilingual Vision-Language Encoders Fail on Low-Resource Languages?

模型评测模型行为与机制分析

摘要

最近的多语言视觉——语言编码器在一个模型中涵盖了数百种语言,但在两个最先进的实例上,低资源语言(LRL;例如斯瓦希里语)的检索落后于高资源语言(HRL;例如英语)$30^+$\,pp。我们询问这个间隙位于经过训练的编码器中的哪个位置。先前的模态间隙和跨语言子空间工作表明输出处的线性语言方向挤出了与对齐相关的几何形状。我们伪造了这一点:LEACE 将线性语言分类器从 $>99\%$ 驱动到接近机会,并将 INLP 迭代到 $37$-$50\%$,而 LRL 检索在 $\pm 1.5$\,pp 内移动,所有层均值在 $2.2$\,pp 内移动,跟踪随机控制。线性偏差是\emph{症状},而不是原因。相反,对齐因果因素位于编码器的前向路径上:EOS(序列结束)隐藏状态的每种语言轨迹随深度而发散。在投影仪将斯瓦希里语从一个编码器上的 $22.1\%$ 提升到 $69.1\%$ 之前三个街区,用其平行英语值替换 EOS(并在另一个编码器上再现);三个控制排除了合并位置同义反复和英语特异性。将每种语言的投影拉向并行内容质心的前层主干证实了训练时的诊断,在 LRL XM3600 检索(1{,}000 个图像子集)上恢复了 $+9.6$ / $+17.1$\,pp,在三个进一步的基准测试中获得了一致的增益,同时保持了 HRL 性能。