论文
您只需要视觉提示吗?研究渐进式视觉支架下的 VLM 空间推理
Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds
摘要
视觉语言模型(VLM)在多模态推理方面进展迅速,但最近的研究表明,它们的失败往往反映了视觉基础和下游推理之间的相互作用。尚不清楚的是,当潜在的推理问题不变时,任务的视觉呈现如何塑造模型性能和故障模式。我们在 SPaRC(基于网格的视觉空间规划的基准)中研究了这个问题,通过引入轻量级输入侧支架来保留视觉形态,同时使空间结构更易于访问。在多个 VLM 中,这些支架将原始视觉设置的任务准确性提高了高达 34.0 个百分点,并进一步补充了基于 GRPO 的训练,与原始视觉输入的增益接近于零相比,额外获得了高达 4.6 个百分点的准确性。对端到端任务解决和目标检测的分析表明,这些收益与视觉证据对齐相关错误的减少密切相关,而规则推理仍然相对具有挑战性。我们发现视觉呈现是决定 VLM 基准是否衡量扎根感知、下游推理或两者混合的核心因素。