论文

迭代视觉思维与 VLM 视觉定位中的自我校正幻象

Iterative Visual Thinking and the Self-Correction Mirage in VLM Grounding

模型评测评测方法与指标

摘要

让视觉语言模型(VLM)在测试时思考更长时间已经推动了最近的进展。实现空间基础的一种自然方法是视觉自我校正:模型预测边界框,看到它在图像上渲染,并通过几个步骤对其进行细化。我们构建了这个想法的忠实实例,迭代视觉思维(IVT),采用两阶段配方:有监督的热身,其中基础模型自身的预测充当现实错误,教师 VLM 将其转化为正确的推理轨迹(产生无需人工注释的训练数据),然后是具有简单 IoU 奖励的 GRPO。按照通常报告的方式测量此类系统,它是有效的:经过训练的模型超过单次基础 +2.4pp Acc@0.5。我们证明这种增益是一种测量幻象。报告的数字默默地保留了每个样本最接近 真值 框的轨迹步骤:一个需要它预测的答案的预言机。在可部署的、无标签的停止规则下重新评分,改进消失了,最好的策略是根本不迭代:在步骤 0 处停止匹配基础并击败每个可交付的规则。原因是验证失败,因为模型可以在其轨迹中的某处生成更好的框,但无法识别它。自我验证置信度与正确性的相关性很弱(r 约为 0.22),反事实叠加显示循环对渲染框的存在而不是其正确性做出反应。我们将教训提炼成诚实轨迹评估协议:固定无标签策略下的准确性加上明确的预言机可交付差距。