论文
用于减少多模态视觉冗余的潜在噪声掩模 大语言模型
Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models
摘要
多模态 大语言模型 (MLLM) 在细粒度视觉推理中经常失败,因为与问题相关的视觉线索被密集和冗余的图像标记稀释。最近的多模态推理方法通常将思想链从语言模型延伸到视觉或潜在空间,寻求添加中间推理状态,同时忽略冗余视觉标记的负面影响。我们提出了LatEnt Noise mask (Lens),这是一种问题条件视觉证据净化框架,使 MLLM 能够在潜在空间中使用更清晰的视觉线索进行推理。 Lens 引入了轻量级 Lens Evidence Token (LET) 来对支持当前问题的视觉标记进行评分,并在解码过程中保留它们。在 LET 分数的指导下,它将自适应潜在噪声注入低相关性标记中,轻柔地抑制干扰因素,而无需更改模型主干或标记序列。 Lens 仅使用一个临时可学习控制词元和一个轻量级噪声生成器,增加了最小的开销,同时在大多数 VQA 数据集上将基本 MLLM 提高了 2.4-6.4 点,在视觉定位任务上提高了 4.1-6.4 点。这些结果表明,多模态推理可以更直视觉定位受益于更清晰的问题相关视觉证据,而不是简单地扩展推理轨迹。