论文

焦点推理:视觉语言模型的有状态、基于动作的视觉聚焦

Foveated Reasoning: Stateful, Action-based Visual Focusing for Vision-Language Models

模型推理推理策略与问题分解

摘要

视觉语言模型受益于高分辨率图像,但视觉标记数量的增加会带来高昂的计算开销。人类通过注视点来解决这种紧张:粗略的观点引导“看向哪里”,而选择性获取的高敏锐度证据则细化“思考什么”。我们引入了 Foveated Reasoner,这是一种自回归视觉语言框架,它将注视点和推理统一在单个解码轨迹中。从低分辨率视图开始,该模型仅在需要时触发注视点,从选定区域检索高分辨率证据,并将其注入回相同的解码轨迹。我们使用两阶段管道来训练该方法:冷启动监督引导中心点行为,然后进行强化学习,共同提高证据获取和任务准确性,同时阻止琐碎的“看到一切”解决方案。实验表明,该方法可以学习有效的注视点策略,并在多个视觉语言基准的严格视觉 词元预算 下实现更高的准确性。