论文

DriveCtrl:条件模拟到真实驾驶视频生成

DriveCtrl: Conditioned Sim-to-Real Driving Video Generation

应用与实践内容创作

摘要

大规模标记的驾驶视频数据对于训练自动驾驶系统至关重要。尽管模拟提供了可扩展且完全注释的数据,但合成驾驶视频与真实世界驾驶视频之间的域差距极大地限制了其下游部署的实用性。现有的视频生成方法不太适合此任务,因为它们无法同时保留场景结构、对象动态、时间一致性和视觉真实感,所有这些对于维护生成数据中的注释有效性至关重要。在本文中,我们提出了 DriveCtrl,一种深度条件可控的模拟到真实视频生成框架,用于逼真的驾驶视频合成。 DriveCtrl 基于预训练的视频基础模型构建,引入了结构感知适配器,可实现深度引导生成,同时保留源模拟的场景布局和运动模式,生成与原始模拟序列保持一致的时间连贯驾驶视频。我们进一步引入了可扩展的数据生成管道,可将模拟器视频转换为与目标真实世界数据集的视觉风格相匹配的真实驾驶镜头。该管道支持三种调节信号:结构深度、参考数据集样式和文本提示,同时保留下游感知任务的帧级注释。为了更好地评估这项任务,我们提出了一种特定于驾驶领域的知识评估指标,称为驾驶视频真实度得分(DVRS),用于评估生成视频的真实度。实验表明,DriveCtrl 在真实性、时间质量和感知任务性能方面始终优于基本模型和竞争替代方案,从而大大缩小了驱动视频生成的模拟与真实差距。