论文

CoWorld-VLA:自动驾驶多专家世界模型的思考

CoWorld-VLA: Thinking in a Multi-Expert World Model for Autonomous Driving

应用与实践行业应用

摘要

视觉-语言-动作(VLA)模型已成为端到端自动驾驶的有前途的范例。然而,现有的推理机制仍然难以提供面向计划的中间表示:文本思想链(CoT)无法保留连续的时空结构,而潜在世界推理仍然难以用作动作生成的直接条件。在本文中,我们提出了 CoWorld-VLA,这是一种用于自动驾驶的多专家世界推理框架,其中世界表示作为指导行动规划的明确条件。 CoWorld-VLA 通过多源监督提取互补的世界信息,并将其编码为 VLA 内的专家词元,从而提供规划者可访问的调节信号。具体来说,我们构建了四种类型的标记:语义交互、几何结构、动态演化和自我轨迹标记,它们分别建模交互意图、空间结构、未来时间动态和行为目标。在动作生成过程中,CoWorld-VLA 采用基于扩散的分层多专家融合规划器,该规划器在整个联合去噪过程中与场景上下文相结合,以生成连续的自我轨迹。 NAVSIM v1 和 v2 上的实验展示了未来场景建模能力和强大的规划性能,包括防撞和轨迹精度。消融研究进一步验证了专家词元的互补性及其作为行动生成的规划条件的有效性。代码可在 https://github.com/AFARI-Research/CoWorld-VLA 获取。