论文

多步视觉推理的分层去噪

Hierarchical Denoising For Multi-Step Visual Reasoning

模型推理解码与生成控制

摘要

视频模型正在演变为视觉基础模型,但它们仍然缺乏类人的多步骤推理。流式自回归扩散模型高效,但推理能力有限,而双向扩散由于密集的帧级去噪,可以实现全局修正,推理成本较高。这两种范式都在努力实现复杂推理任务的逻辑一致性和低延迟流。我们提出了 HDR(视觉推理分层去噪),这是一个统一的框架,它将分层潜伏集成到因果视频生成中以进行多步推理。 HDR 将视频潜在层组织成树状结构的层次结构,从而在流式输出之前实现从粗到细的推理。粗略的去噪层为全局规划保留了不确定的假设,而更精细的层则逐渐将它们细化为具体的视觉状态。稀疏分层注意力模式(SHAP)进一步降低了时间注意力成本。我们引入了一种具有分布外情况的分层多步视频推理基准,涵盖六个任务:迷宫导航、汉诺塔、单线绘制、滑动拼图、推箱子和倒水。与流式自回归扩散基线相比,HDR 将成功率从 34.22 提高到 60.29(相对增益 76.2%),并将平均进度从 76.00 提高到 89.56,展示了更一致的推理轨迹。 HDR 将低延迟流保持在每个延迟 0.70 秒,推理速度比双向扩散快 54.2 倍。它还仅用 2% 的训练数据保留了 82.9% 的全数据性能,而双向扩散的性能为 52.0%。真实世界的机器人实验进一步证明了 HDR 在物理交互和世界建模方面的潜力。项目演示:https://hierarchical-diffusion-reasoning.github.io/。