Adaptive-WAM:根据中间视频扩散功能进行质量引导的提前退出规划
Adaptive-WAM: Quality-Guided Early-Exit Planning from Intermediate Video-Diffusion Features
摘要
大型视频扩散模型为自动驾驶提供了丰富的时空先验,但现有的世界动作模型通常继承了迭代未来视频生成的成本,即使部署只需要自我轨迹。我们提出一个更基本的问题:必须执行多少视频扩散模型才能做出可靠的驾驶决策?通过对视频去噪时间步长和扩散 Transformer (DiT) 深度的受控研究,我们发现规划性能在很大程度上对测试的视频噪声水平不敏感,而强轨迹已经可以从中间层解码。基于这一观察,我们引入了 Adaptive-WAM,这是一种基于 Wan2.2-5B 主干网络构建的质量感知多出口规划器。轨迹扩散头附加到选定的 DiT 块上,一旦迄今为止解码的最佳轨迹满足质量阈值,轻量级轨迹质量评分器就会终止推理;否则,计算将从缓存的隐藏状态继续到更深的出口。因此,部署的规划器避免了未来视频合成所需的迭代无分类器去噪循环和 VAE 解码,同时根据轨迹质量动态分配主干深度。在NAVSIM上,自适应单轨迹规划器达到90.8 PDMS;一个单独的固定出口变体达到 92.6 PDMS,有 64 个提案。它还在 NAVSIM v2 上获得了 89.9 EPDMS,在比较的前视视频世界模型规划器中产生了最佳报告结果。如果没有目标域 微调,自适应 WAM 会以 0.88 m 平均 L2 误差和 0.08\% 冲突率传输到 nuScene。在 A100 上,自适应路由将 PDMS 从 90.62 提高到 90.79,同时平均端到端规划延迟为 170 毫秒,比 190 毫秒固定块 15 规划器低约 10%,比 320 毫秒固定全深度规划器低 47%。代码将被发布。