论文
视觉语言模型中的感知带宽瓶颈:通过顺序实验设计进行主动视觉推理
The Perceptual Bandwidth Bottleneck in Vision-Language Models: Active Visual Reasoning via Sequential Experimental Design
摘要
现代视觉语言模型(VLM)中的视觉感知受到感知带宽瓶颈的限制:广阔的视野保留了全局背景,但牺牲了复杂推理所需的细粒度细节。因此,我们认为高分辨率视觉推理不仅是语义推理,而且是有限感知带宽下与任务相关的证据获取。受主动视觉和信息搜寻的启发,我们将这一过程形式化为顺序贝叶斯最优实验设计(S-BOED),其中代理决定在回答之前获取哪些视觉证据。由于精确的贝叶斯推理在连续的十亿像素空间中很难处理,因此我们得出了一个易于处理的覆盖范围-分辨率目标作为任务相关信息增益的代理。我们使用 FOVEA 实例化该框架,FOVEA 是一个 无需训练 程序,可通过面向证据的探测来完善 VLM 作物建议。高分辨率基准的实验表明,与直接基准和 ReAct 式基准相比,获得了一致的增益,尤其是在搜索主导的遥感设置中得到了显着的改进。