论文

FrozenDrive:使用无参数冻结扩散模型进行零样本文本引导驾驶场景生成和数据增强

FrozenDrive: Zero-Shot Text-Guided Driving Scene Generation and Data Augmentation with Parameter-Free Frozen Diffusion Model

应用与实践内容创作

摘要

在扩散模型的推动下,自动驾驶的合成数据正在激增,这些模型有望实现可扩展的场景生成。然而,关键的障碍仍然存在,因为实施多视图和时间一致性通常依赖于主干 微调 或添加的层,这会侵蚀预先训练的知识并削弱文本对齐。模型也保持接近训练分布,在恶劣天气和看不见的配置下挣扎,并且保真度倾向于频繁的类别而不是稀有的类别。我们使用 FrozenDrive 来解决这些差距,FrozenDrive 是一个可控的生成框架,可以保留预训练的扩散模型知识,同时实现强一致性。 FrozenDrive 以丰富的驱动堆栈信号和文本提示为条件,并引入知识保留时空注意力,以在无参数冻结扩散主干内的单次传递中强加跨视图对齐和时间连贯性。附加的以对象为中心的约束提高了稀有类别的每个对象的保真度。在没有任何特定于天气或场景的 微调 的情况下,我们的模型从文本中合成了全局连贯的多视图驾驶场景,特别是在不利和罕见的条件下,并且超越了之前的基线。在 nuScenes 上,FrozenDrive 增强数据显着提高了 AD 模型的性能,尤其是在夜间和雨天,在使用我们的场景目标数据进行训练时表现出更强的鲁棒性。