论文

See2Think:多模态模型真的使用中间视觉状态吗?

See2Think: Do Multimodal Models Really Use Intermediate Visual States?

模型评测基准与评测资源

摘要

多模态 大语言模型 在推理过程中越来越多地使用草图、注释、工具和中间图像,但仍不清楚它们是否真正依赖这些视觉状态。现有的基准受到覆盖范围窄或部分文本可解决样本的任务集合以及强调最终答案而不诊断中间视觉状态如何生成、渲染和使用的评估的限制。我们推出了 See2Think,这是一个由 See2ThinkBench 和 Visual Action-of-Thought (VAoT) 组成的统一评估框架。 See2ThinkBench 包含 1,200 个开放式、视觉相关问题,涉及 12 个任务类别,涵盖 2D 结构化、3D 场景和现实世界推理。 VAoT 在四种受控推理设置下记录文本思想、视觉动作、渲染状态和后续推理。通过评估代表性的专有和开源多模态模型,我们发现视觉推理强烈依赖于模型和环境,没有单一的设置在任务中始终占主导地位。过程分析进一步表明,模型通常会选择相关的视觉操作,而忠实渲染仍然是最明显的瓶颈,高反馈吸收并不一定会转化为准确性的提高。在与任务相关的损坏反馈下,模型表现出对视觉状态的行为依赖性,在受控干预中,准确性下降了 10 个百分点以上。