论文

Horizo​​nWeaver:驾驶场景的通用多级语义编辑

HorizonWeaver: Generalizable Multi-Level Semantic Editing for Driving Scenes

应用与实践内容创作

摘要

确保自动驾驶的安全性需要可扩展地生成超出现实世界测试所能提供的真实、可控的驾驶场景。然而,现有的指令引导图像编辑器接受了以对象为中心或艺术数据的训练,难以应对密集、安全关键的驾驶布局。我们提出了 Horizo​​nWeaver,它解决了驱动场景编辑的三个基本挑战:(1)多级粒度,需要在密集环境中进行连贯的对象级和场景级编辑; (2)丰富的高层语义,在遵循详细指令的同时保留多样化的对象; (3) 无处不在的领域转移,处理看不见的环境中的气候、布局和交通变化。 Horizo​​nWeaver 的核心是一组跨数据、模型和训练的互补贡献:(1) 数据:大规模数据集生成,我们从 Boreas、nuScenes 和 Argoverse2 构建配对的真实/合成数据集以提高泛化能力; (2) 模型:用于细粒度编辑的语言引导蒙版,其中语义丰富的蒙版和提示可实现精确的语言引导编辑; (3) 训练:内容保存和指令对齐,其中联合损失增强场景一致性和指令保真度。 Horizo​​nWeaver 共同提供了一个可扩展的框架,用于对复杂驾驶场景进行逼真、指令驱动的编辑,收集 13 个编辑类别的 255K 图像,并在 L1、CLIP 和 DINO 指标方面优于先前的方法,实现了 +46.4% 的用户偏好,并将 BEV 分割 IoU 提高了 +33%。项目页面:https://msoroco.github.io/horizo​​nweaver/