论文
VGGTWorld-VLA:自动驾驶的意向条件 3D 世界进化
VGGTWorld-VLA: Intent-Conditioned 3D World Evolution for Autonomous Driving
摘要
VGGT 通过从视觉观察中恢复统一的 3D 场景几何形状,为以几何形状为中心的世界模型提供了坚实的基础。尽管最近的扩展实现了时间 3D 预测,但它们的未来演化仍然弱地依赖于驱动意图和行动,限制了它们对依赖行动的替代未来进行建模的能力。我们提出了 VGGTWorld-VLA,这是 VGGT-World 的有意条件扩展,用于自动驾驶中可控的 3D 世界演化。首先,我们引入了一种动作语义调节机制,它将互补的驱动语义和自我运动表示注入未来token流中,从而在替代自我动作下对同一观察场景进行不同的未来几何预测。其次,我们开发了一个几何-语言-动作桥梁,它适应历史几何、VLA 语义特征以及机动和轨迹表示,以联合调节未来几何预测。我们在 NAVSIM 上评估未来的几何预测,同时条件消融进一步检查语义和语义的贡献 行动信息。与基线相比,我们的方法展示了有竞争力的几何预测性能。消融研究进一步支持语义和动作调节的有效性。这些结果证明了语义和动作调节在自动驾驶中基于 VGGT 的可控世界预测的潜力。