论文
世界动作交互模型的黎明
The DAWN of World-Action Interactive Models
摘要
合理的场景演变取决于所考虑的机动,而良好的机动则取决于场景如何演变。现有的世界行动模型(WAM)在很大程度上忽略了这种互惠性,将世界预测和行动生成视为孤立的并行分支或严格的预测然后计划管道。我们将这一视角形式化为世界动作交互模型(WAIM),并用 \textbf{DAWN} (\textbf{D}enoising \textbf{A}ctions 和 \textbf{W}orld i\textbf{N}teractive model)在自动驾驶中实例化它,这是一个简单但强大的潜在生成基线。 DAWN 在紧凑的语义潜在空间中运行,并将 \emph{World Predictor} 与 \emph{World-Conditioned Action Denoiser} 结合起来:预测的世界假设条件动作去噪,而去噪的动作假设被反馈以更新世界预测,以便两者在推理过程中递归地细化。 DAWN 不是完全消除测试时的世界演化或在像素空间中采样轨迹完整的未来,而是执行短暂的显式潜在采样轨迹,足以支持复杂交互场景中的长视野轨迹生成。实验表明,DAWN 在多个自动驾驶基准测试中实现了强大的规划性能和良好的安全相关结果。更广泛地说,我们的结果表明,交互式世界行动生成是实现真正可行的世界模型的原则路径。