论文

用于减轻视觉语言模型中模态主导的信息路由器

Information Router for Mitigating Modality Dominance in Vision-Language Models

上下文与知识上下文工程

摘要

视觉语言模型 (VLM) 在各种基准测试中都表现出了强大的性能,但它们经常受到模态主导的影响,即预测不成比例地依赖于单一模态。先前的方法主要通过引导模型的注意力分配来解决这个问题,隐含地假设所有模式都提供足够的信息。然而,注意力仅决定模型关注的位置,并不能丰富缺失或模糊的信息。在现实世界中,输入方式通常在信息密度及其信噪比方面有所不同。在这种情况下,简单地调整模型的注意力并不能解决潜在的信息缺乏问题。在本文中,我们提出 \textsc{MoIR}:\textit{多模态信息路由器},一种信息级融合方法,可在融合之前显式减少信息差异。 \textsc{MoIR} 识别信息较少的标记,并从更强的模态路由补充信息,在 大语言模型 处理它们之前构建信息密集的标记表示。通过修改信息可用性,\textsc{MoIR} 可以实现模态主导地位的可靠转变,即使一种模态退化也是如此。我们在跨多个模型主干的三个广泛使用的多模态基准上评估 \textsc{MoIR}。实验结果表明, \textsc{MoIR} 始终表现出更平衡的模态贡献,并提高了鲁棒性和下游性能,特别是在模态退化的情况下。这些发现表明,显式修改跨模态信息是减轻多模态推理模型中模态主导地位的有效且补充的策略。