用于 AV 场景预测的 Diffusion Transformer 世界动作模型
Diffusion Transformer World-Action Model for AV Scene Prediction
摘要
动作调节的世界模型让自动驾驶汽车能够根据自己计划的控制来预测未来的摄像头场景,从而无需在现实世界中进行规划和模拟,但在紧凑、可训练的规模上,未来是模糊的,并且该领域的标准失真指标会产生积极的误导:它们奖励的是模糊的回归均值而不是现实的预测。我们用一个紧凑的潜在世界模型来面对这个问题,该模型在给定当前前置摄像头潜在和一系列自我动作的情况下,预测冻结解码器在提前 8 秒内渲染到 256 × 256$ 帧的未来场景潜在,并在 150 个保留的 nuScenes 场景上进行评估。我们首先对预测位置进行基准测试:在跨越四个表示系列的六个冻结编码器中,具有时间上下文的 V-JEPA2 比最佳单帧编码器将转向 RMSE 降低了 40%。然后,我们训练潜在扩散 Transformer (DiT),并通过受控诊断,识别其所需的四个要素:空间标记、$x_0$ 目标、残差锚定以及与目标不确定性匹配的采样。在稳定扩散 VAE 编码-预测-解码管道中,我们暴露了中心张力:失真度量(余弦相似度,SSIM)有利于模糊均值,掩盖扩散模型更接近真实帧分布。基于 Inception 的 FID 和 KID 揭示了一个清晰的感知失真边界:扩散达到 KID 0.078,而回归则达到 0.375($4.8\times$ 更好),并且可部署的训练派生校准使得无需测试时间 真值 即可实现这一点。该模型是真正的动作可控(转向驱动场景位移,Spearman $ρ= 0.81$,而回归则为 $-0.18$)。我们将有限的单通道运动跟踪到共享存在的锚点,并设计了一个紧凑的 1.7M 参数“跳跃”模型,该模型可以恢复完整的 真值 运动幅度($1.02\times$GT),其中单通道模型捕获不到一半。