论文
带视觉定位的思考
Thinking with Visual Grounding
摘要
视觉思考不应只是说得对——还应展示证据。虽然近期视觉语言模型(VLM)能产出自然语言推理踪迹——但这些踪迹常把支撑的图像区域留在隐式状态——难以验证也难以监督。我们引入视觉定位思考——推理过程:模型把自然语言思想与每步所用视觉证据的显式点或框锚定交错。这使模型用语言表达中间推理——同时把关键对象锚定到其指涉的图像区域。为训练该行为——我们构建可扩展合成管线:蒸馏正确视觉推理踪迹、抽取踪迹所需视觉对象、以基于SAM3的智能体锚定它们——并从所得掩码导出对齐的点与框监督。我们进一步提出锚定感知强化学习——组合答案正确性奖励与密集锚定奖励——后者为生成的对象指涉是否匹配正确图像证据打分。跨两个计数基准与四个空间推理基准——为Gemma3-4B-IT加入视觉定位思考持续超越原模型与非锚定思考基线。在空间推理上——视觉定位思考的4B模型匹敌并在某些情形超越同家族的Gemma3-27B-IT。我们的分析显示点锚定最适合计数——而框锚定在空间任务上从显式锚定奖励获益最大。总体而言——结果表明:当中间思想与使其为真的图像区域绑定时——VLM思考得更好。
