论文

CosmosAlign:采用世界基础模型进行生成交通视频预测

CosmosAlign: Adapting a World Foundation Model for Generative Traffic Video Forecasting

模型训练监督微调与指令调优

摘要

生成式交通视频预测旨在从简短的观察历史和文本描述中合成长期、时间连贯的未来交通场景视频。在本文中,我们提出了 CosmosAlign,这是一种基于预训练的 Cosmos3-Nano 世界基础模型构建的生成式交通视频预测框架。我们的方法的动机是观察到成功地使大型预训练世界模型适应下游预测任务主要取决于分布对齐而不是增加模型容量。为此,我们提出了一种两阶段 LoRA 适应策略,首先将条件模式分布与目标预测任务对齐,然后通过基于 LLM 的重新字幕管道将训练字幕与模型的本机结构化提示界面对齐。在推理过程中,我们使用完整的 无需训练 程序进一步提高预测质量,该程序包括基于共识的中心点样本选择和静态场景区域的运动自适应混合。 CosmosAlign 在 AI City Challenge 2026 Track 5 基准测试中获得 76.49 分的最终成绩,位列最终排行榜第一。我们的代码可在 https://quangminhdinh.github.io/CosmosAlign/ 上公开获取。