论文
为什么视觉作为通用桥梁失败了:纠正多语言 MLLM 中的模态异步
Why Vision Fails as a Universal Bridge: Rectifying Modality Asynchrony in Multilingual MLLMs
摘要
多模态 大语言模型 (MLLM) 在非英语视觉推理中表现出显着的性能下降,尽管其纯文本主干具有强大的多语言能力。虽然来自纯文本模型的机械证据表明非英语输入是通过以英语为中心的潜在空间传递的,但这种现象的多模态含义仍未得到探索。通过严格的机制分析,我们识别出了 \textbf{Ghost Anchor} 现象:一种时间模态异步,其中英语语义流形的语言翻译在早期层完成,而视觉语义化仍然不成熟。因此,视觉信号在早期对准窗口期间物理上存在但功能上不可见。为了纠正这个问题,我们提出了 \textbf{ANCHOR},这是一种采用主动视觉锚定(PVA)来加速早期视觉语义出现的训练框架,确保视觉表示主动指导语言翻译。机械干预证实 ANCHOR 成功恢复了早期翻译过程中视觉信号的因果影响。此外,在 XMMMU、MaXM 和 CVQA 上的大量实验表明,ANCHOR 始终优于标准基线,在微调语言和零样本语言中实现了强大的视觉推理。