论文
从像素到 BFS:高迷宫精度并不意味着视觉规划
From Pixels to BFS: High Maze Accuracy Does Not Imply Visual Planning
摘要
多模态模型如何解决视觉空间任务——通过真正的规划,还是通过词元空间中的强力搜索?我们引入了 \textsc{MazeBench},这是跨 9 个受控组的 110 个程序生成的迷宫图像的基准,并评估了来自 OpenAI、Anthropic、Google 和阿里巴巴的 16 个模型配置。 GPT-5.4 解决了 91%,Gemini 3.1 Pro 解决了 79%,但这些分数具有误导性:模型通常将图像转换为文本网格,然后逐步枚举路径,对于人类快速完成的任务,每个解决方案消耗 1,710--22,818 个词元。在不增加推理预算的情况下,所有配置得分仅为 2--12\%;在 20×20的超难迷宫中,他们达到了词元限制并失败了。定性痕迹揭示了一个常见的两阶段策略:图像到网格的转换,然后是 词元级 搜索,在散文中有效的 BFS。文本网格消融显示,当给出正确的网格时,Claude Sonnet 4.6 从图像上的 6% 上升到 80%,从而将弱视觉提取与下游搜索隔离开来。当明确指示不要构建网格或执行图形搜索时,模型仍然恢复到相同的枚举策略。 \textsc{MazeBench} 因此表明,视觉规划任务的高精度并不意味着像人类一样的空间理解。