论文

DiffWAM:快速高效的导航世界行动模型

DiffWAM: A Fast and Efficient Navigation World Action Model

模型推理推理加速

摘要

预训练的视频基础模型为具体导航编码丰富的语义和时空先验,但将这些先验转换为无人机运动通常需要昂贵的未来视频合成和几何重建。我们研究是否可以直接从冻结视频模型的预测表示中恢复未来视觉预测中隐含的运动。为此,我们提出了 DiffWAM,一种几何条件导航世界动作模型,可直接将多级预测特征转换为连续的相机轨迹。其 Grid-Motion 模块保留时空运动关联,而 Latent2Pose 将它们与第一帧几何体结合起来,以恢复具有度量意义的 3D 运动。仅在离线监控时才需要完整的视频rollout和几何重建,从而消除了部署期间的未来视频解码和多帧重建。我们进一步介绍了 FastDreamer,它将预测和几何计算与正在进行的飞行重叠,并执行时间戳感知的异步轨迹切换以实现连续的无人机执行。 DiffWAM 在 1,000 个样本的 DiffWAM-1000 基准上实现了 0.3492 m 的轨迹 RMSE 和 74.40% 的端点成功率,而代表性的现实世界实验展示了复杂的行为,包括约束遍历、轨道运行、S 形飞行和多级导航。板载 DiffWAM-Flash 实现在 NVIDIA Jetson AGX Thor 上进一步达到 1.08 秒的模型管道延迟。这些结果表明,预测视频表示可以有效地融入连续 3D 运动,为生成然后重建导航管道提供直接替代方案。项目页面:https://zzmmzzm.github.io/diffwam.github.io/.