论文
从衰减到注意:细粒度视觉感知的变分信息流操纵
From Attenuation to Attention: Variational Information Flow Manipulation for Fine-Grained Visual Perception
摘要
虽然多模态 大语言模型 (MLLM) 在一般视觉理解方面表现出了令人印象深刻的能力,但它们在需要识别微小物体或辨别微妙视觉关系的细粒度感知任务中经常表现不佳。我们将此限制归因于视觉衰减:稀疏的细粒度视觉信号在网络传播过程中被占主导地位的文本标记过早抑制或稀释的现象,导致深层决策过程中“失去焦点”。现有的以输入为中心的解决方案无法从根本上扭转这种信息丢失的内在机制。为了应对这一挑战,我们提出了变分信息流(VIF)框架。 VIF 采用概率视角,利用条件变分自动编码器 (CVAE) 将与问答对相关的视觉显着性建模为潜在分布。作为即插即用模块,VIF 可以集成到现有架构中。跨不同基准的广泛评估,涵盖通用 VQA、细粒度感知和视觉基础,表明 VIF 比以前的方法产生了竞争性改进,验证了其在增强 MLLM 细粒度感知方面的有效性。