论文

HMPDM:利用历史运动先验驱动视频预测的扩散模型

HMPDM: A Diffusion Model for Driving Video Prediction with Historical Motion Priors

应用与实践内容创作

摘要

视频预测对于自动驾驶来说是一项有用的功能,它使智能车辆能够可靠地预测驾驶场景将如何演变,从而支持推理和更安全的规划。然而,现有模型受到多阶段训练流程的限制,在模拟真实驾驶场景中的各种运动模式方面仍然不足,导致时间一致性和视觉质量下降。为了应对这些挑战,本文引入了历史运动先验信息扩散模型(HMPDM),这是一种利用历史运动先验来增强运动理解和时间一致性的视频预测模型。所提出的深度学习系统引入了三个关键设计:(i)用于隐式历史运动注入的时间感知潜在条件(TaLC)模块; (ii) 用于多尺度运动表示的运动感知金字塔编码器(MaPE); (iii) 用于稳定迭代去噪的自我调节(SC)策略。针对 Cityscapes 和 KITTI 基准的大量实验表明,HMPDM 的效率优于最先进的视频预测方法,在相同的单目 RGB 输入配置设置下,Cityscapes 的 FVD 提高了 28.2%。实现代码可在 https://github.com/KELISBU/HMPDM 上公开获取。