论文

VistaGEN:使用多视图视觉语言推理通过细粒度控制生成一致的驾驶视频

VistaGEN: Consistent Driving Video Generation with Fine-Grained Control Using Multiview Visual-Language Reasoning

应用与实践内容创作

摘要

驾驶视频生成在可控性、视频分辨率和长度方面取得了很大进步,但无法支持各种驾驶视频的细粒度对象级可控性,同时保持时空一致性,特别是在长视频生成中。在本文中,我们提出了一种名为 VistaGEN 的新型驾驶视频生成技术,该技术能够对特定实体(包括 3D 对象、图像和文本描述)进行细粒度控制,同时保持长视频序列的时空一致性。我们的关键创新是将多视图视觉语言推理纳入长驱动视频生成中。为此,我们将视觉语言功能注入多视图视频生成器中,以实现细粒度的可控性。更重要的是,我们提出了一种多视图视觉语言评估器(MV-VLM)来智能地自动评估生成内容的时空一致性,从而制定一种新颖的生成-评估-再生闭环生成机制。该机制可确保高质量、一致的输出,有助于创建复杂且可靠的驾驶场景。此外,在闭环生成中,我们引入了对象级细化模块来细化从MV-VLM评估的不满意结果,然后将它们反馈到视频生成器进行再生。广泛的评估表明,我们的 VistaGEN 实现了多样化的驾驶视频生成结果,具有细粒度的可控性,特别是对于长尾物体,并且比以前的方法更好的时空一致性。