论文
JEPA 引导扩散:用于生成交通预测的预测视觉语言调节
JEPA Guided Diffusion: Predictive Vision-Language Conditioning for Generative Traffic Forecasting
摘要
准确的交通预测需要了解场景动态并综合现实的未来观察结果。最近基于扩散的视频生成模型可以产生视觉上合理的预测,但需要昂贵的端到端训练,并且经常将场景理解与图像合成纠缠在一起。在这项工作中,我们提出了一个解耦的预测框架,将未来的表示学习与视频生成分开。冻结的 V-JEPA 编码器首先从观察到的交通视频中提取预测潜在表示,捕获语义潜在空间中的底层场景动态。然后,轻量级潜在对齐模块将这些表示投影到冻结 Cosmos 扩散模块的调节空间中,从而实现未来的视频合成,而无需重新训练大型生成模型。通过冻结所有基础模型并仅训练轻量级对齐模块,所提出的框架大大降低了优化复杂性,同时保留了预测能力。 AI City Challenge 2026 Track 5 基准测试的实验结果表明,该方法取得了 75.1297 的成绩,在比赛中排名第三。这些结果表明,V-JEPA 学习的预测世界表示可以有效指导下游视频生成,为基于端到端扩散的预测提供了实用且高效的替代方案。