论文
LoMo:局部模态替代以实现更深入的视觉语言融合
LoMo: Local Modality Substitution for Deeper Vision-Language Fusion
摘要
在旨在多模态融合的大规模图像文本训练的推动下,视觉语言模型(VLM)在广泛的理解和推理任务中取得了实质性进展。理想情况下,用渲染图像对应的文本问题替换文本问题应该不会影响模型性能。然而,在实践中,这种模态替代会导致性能急剧下降。我们将这种“载体敏感性”问题归因于当前训练语料库的固有偏差。在图像字幕、VQA、OCR 和网络来源的交错数据等流行数据集中,文本和图像通常被组织成不同且不对称的角色,其中文本充当语言查询,图像充当视觉参考。这种数据偏差导致 VLM 对不同方式的信息获取表现出不同的偏好。因此,VLM 无法跨文本和视觉载体对齐语义等效内容的表示,使得模型推理在模态替换下变得脆弱。为了解决这个问题,我们提出了局部模态替换(LoMo),这是一种轻量级的、与架构无关的数据管理范式,旨在为语义等效的文本和图像载体之间的跨模态表示不变性提供监督。 LoMo 通过将单模态提示重新表述为无缝交错的多模态序列来实现这一目标。它动态选择目标文本范围并将其重新转换为渲染图像,从而在“文本、视觉、文本”载体上保留相同的语义。跨越 13 个不同多模态基准的广泛实验表明,LoMo 显着改善了整体多模态推理并产生更深入的跨模态融合。具体来说,它在各个基础模型上提供了一致的增益,在 LLaVA-OneVision-1.5-8B 上比标准 SFT 提高了 2.67 点,在 Qwen3.5-9B 上比标准 SFT 提高了 2.82 点。