论文
测试时间缩放超过感知:解决图像思维中的基础悖论
Test-time Scaling over Perception: Resolving the Grounding Paradox in Thinking with Images
摘要
最近的多模态 大语言模型 (MLLM) 支持用图像思考,在推理过程中调用缩放和裁剪等视觉工具来检查图像区域。然而,这些系统在细粒度推理中仍然脆弱:为了获得决定性的细节,模型必须将注意力集中在正确的区域上,但知道哪个区域是正确的前提是已经观察到了该细节。我们将这种循环依赖性识别为视觉定位悖论,表明视觉定位错误很少在单个轨迹内自我纠正——一旦检查了误导区域,该观察的所有后续推理条件和错误都会传播到最终答案——并且观察到,因为每个轨迹构建自己的证据,所以答案级聚合丢弃了区分轨迹的信息。我们提出了感知测试时间缩放(TTSP),这是一个闭环框架,它将感知视为可扩展推理的单位,并沿两个轴分配计算:熵门感知探索对不同的轨迹进行采样,并使用关键词元熵来保留模型无法提交的证据,而证据引导的迭代细化将经过验证的观察结果提炼为可纠正的证据账本,引导后续轮次重新检查未解决的区域。在高分辨率和通用多模式基准测试中,TTSP 始终优于强大的测试时间扩展基准,同时以良好的词元效率提高了视觉定位质量。