论文

视觉推理模型:维持多模态中的视觉一致性 大语言模型

Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models

模型架构新型架构

摘要

近年来,多模态 大语言模型(MLLM)取得了显着的进展,这主要归功于整合视觉和文本信息的有效范式。基于连接器的主流范式将视觉特征投射到文本序列中,从而在生成架构中实现统一的多模式对齐和推理。然而,我们的实验揭示了两个关键局限性:(1)虽然视觉信息是 MLLM 中的核心证据模态,但它与文本标记同等对待,削弱了视觉模态的独特贡献; (2)随着生成长度的增加,特别是在有限的上下文窗口内,模型对视觉信息的依赖逐渐减弱,导致视觉语言对齐恶化,生成内容与视觉语义之间的一致性降低。为了应对这些挑战,我们提出了视觉推理器(VIF),这是一个轻量级的架构模块,它在纯视觉表示和模型的输出空间之间建立了直接的桥梁。具体来说,VIF 在整个推理过程的解码阶段不断注入视觉语义,确保模型在生成过程中始终牢固地扎根于视觉内容。我们对 14 项基准任务进行了实验,涵盖一般推理、OCR、表格理解、以视觉为中心的评估和幻觉。实验结果表明,VIF 能够持续提高不同架构中的模型性能,同时引入最小的额外开销。这项工作的代码可在 https://github.com/Dong-Xinpeng/VIF 获取。