论文
视频模型早期推理:利用计划承诺解决迷宫问题
Video Models Reason Early: Exploiting Plan Commitment for Maze Solving
摘要
视频扩散模型表现出新兴的推理能力,例如解决迷宫和谜题,但人们对它们在生成过程中如何推理知之甚少。我们朝着理解这一点迈出了第一步,并使用 2D 迷宫求解作为受控测试平台来研究视频模型的内部规划动态。我们的调查揭示了两个发现。我们的第一个发现是早期计划承诺:视频扩散模型在最初的几个去噪步骤中致力于高级运动计划,之后进一步的去噪会改变视觉细节,但不会改变潜在的轨迹。我们的第二个发现是路径长度,而不是障碍物密度,是迷宫难度的主要预测因素,在 12 步处有明显的失败阈值。这意味着视频模型只能通过将多个连续代链接在一起来对长迷宫进行推理。为了展示我们研究结果的实际好处,我们引入了早期规划链接(ChEaP),它只在有希望的早期计划的种子上花费计算,并将它们链接在一起以解决复杂的迷宫。这将长视野迷宫的准确率从 7% 提高到 67%,在 Frozen Lake 和 VR-Bench 中跨 Wan2.2-14B 和 HunyuanVideo-1.5 的困难任务上总体准确率提高了 2.5 倍。我们的分析表明,当前的视频模型具有比以前认识到的更深入的推理能力,可以通过更好的推理时间缩放来更可靠地引出。