论文

GazeVLM:通过内部注意力控制实现多模态推理的主动视觉

GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning

模型架构Transformer

摘要

人类视觉推理受主动视觉控制,在这个过程中,元认知控制驱动自上而下的目标导向注意力,动态地将中央凹焦点转向与任务相关的细节,同时保持对全局场景的外围意识。相比之下,现代视觉语言模型(VLM)被动地处理视觉信息,依赖于大量词元上下文的静态积累,随着推理链的增长,这些词元上下文会稀释视觉证据。在这里,我们提出了 GazeVLM,这是一种 VLM,它通过在推理链中生成注视动作来学习对其注意力资源进行监督,以 <LOOK> 标签的形式指定要检查的区域的坐标。在训练期间,每个 <LOOK> 块都会触发对注意力 logits 的连续抑制偏差,该偏差会抑制迄今为止所注视的区域之外的特征,并在块的末尾提升,从而恢复全局视图。该模型以这种偏差作为教学信号进行训练,首先通过监督 微调 在策划的凝视推理轨迹上进行训练,然后通过组相对策略优化 (GRPO) 对正确答案和有效基础进行奖励。在部署时,外部抑制被移除,并且模型运行其未经修改的前向传递,将其自身的注意力引导到 <LOOK> 块指示的区域,保留大部分偏差的影响并模拟空间注意力的自上而下的控制。因此,该模型在全局空间意识和局部焦点推理之间转换,无需依赖裁剪等外部代理工具,也无需从重新编码的补丁中添加视觉标记。应用于 4B 参数骨干网时,GazeVLM 在 HRBench-4k 和 HRBench-8k 上展示了强大的高分辨率多模态推理,超出其基本模型约 4 个点,并且优于围绕图像思维构建的代理多模态管道 5 到 12 个点。