论文
GeoRoute:用于交通未来帧预测的几何感知混合推理
GeoRoute: Geometry-Aware Hybrid Inference for Traffic Future-Frame Prediction
摘要
长视野未来帧预测对于自动驾驶、交通监控和智能交通系统非常重要,但由于时间重影、几何漂移和不一致的物体运动,仍然具有挑战性。最近的潜在视频扩散模型已经取得了令人印象深刻的视觉质量,但将它们直接应用于结构化交通场景通常会导致几何形状不稳定,并且在扩展范围内时间相干性降低。我们提出了一个 无需训练 推理框架,该框架通过多帧时间上下文和视图条件路由来稳定预训练视频预测中可靠的静态结构。对于前置摄像头视频,我们的方法使用多帧深度分层渲染器来细化生成的未来,该渲染器从观察到的历史帧中投影静态几何图形,同时保留生成基础模型中的动态区域。对于异构交通视图,冻结视觉语言模型从观察到的剪辑中推断出粗略的摄像机组,并选择专门的基于运动的预测器。该框架既不需要重新训练,也不需要底层视频模型的 微调,并且可以直接应用于预训练的生成器。我们在 AI City Challenge Track 5 基准上验证了所提出的框架,我们的最终系统在顶级团队中实现了具有竞争力的表现。这些结果表明,几何感知推理时间细化和视图条件混合推理可以在不改变原始模型架构的情况下提高静态几何稳定性和底层结构保真度。