论文

ScenarioControl:视觉语言可控的向量化潜空间驾驶场景生成

ScenarioControl: Vision-Language Controllable Vectorized Latent Scenario Generation

应用与实践内容创作

摘要

本文提出ScenarioControl,一种用于学习式驾驶场景生成的视觉语言控制机制。给定文本提示或输入图像,系统生成多样、逼真的三维场景轨迹,包括地图、会作出响应的交通参与者随时间变化的三维边界框、行人、驾驶基础设施和自车相机观测。方法在向量化潜空间中联合表示道路结构和动态交通参与者。为将多模态控制连接到稀疏的向量化场景元素,研究提出跨全局控制机制,结合交叉注意力与轻量级全局上下文分支,在保持真实性的同时,细粒度控制道路布局和交通条件。该方法能够从场景中不同参与者的视角生成时间一致的轨迹,支持驾驶场景的长程延续。为支持训练与评估,研究发布了文本标注与向量化地图结构对齐的数据集。大量实验表明,在各项测试中,ScenarioControl的控制遵循程度和保真度优于被比较的方法。项目网页:https://light.princeton.edu/ScenarioControl