论文

X-Mind:通过端到端驾驶的预测世界模型实现高效的视觉思维链

X-Mind: Efficient Visual Chain-of-Thought via Predictive World Model for End-to-End Driving

模型推理推理策略与问题分解

摘要

预测未来状态对于自主代理至关重要,但当前的视觉-语言-动作(VLA)模型从根本上缺乏这种能力,而是依赖于反应性感知-动作映射。虽然集成预测世界模型 (PWM) 解决了这一差距,但现有方法要么会产生令人望而却步的级联延迟,要么充当浅层终端任务,无法深度嵌入前瞻性推理。为了赋予 VLA 模型这种推理能力,我们提出了 X-Mind。该框架没有将 PWM 视为外部辅助模块,而是将其内部化为视觉思想链 (Visual CoT)。通过在行动之前强制在世界范围内进行推广,该模型必须首先想象未来的演变,从而产生一个强有力地基于环境动态的驱动政策,并意识到其行动将带来的未来后果。这里的挑战是效率,我们从两个方面解决这个问题。首先,我们介绍视觉思维的紧凑表示:将鸟瞰图(BEV)布局与抽象驾驶先验(例如导航意图和交通规则)融合在一起的抽象草图。该模型并没有预测展开密集的未来帧,而是将这个草图作为心理画布进行推理;在深度压缩自动编码器 (DC-AE) 的帮助下,未来的 12帧预测序列将减少到仅 96 个标记,从而缓解了长上下文计算瓶颈。其次,为了进一步加速生成,我们提出了一种循环块扩散方案,该方案在大型驱动模型的各层上展开去噪步骤,将迭代细化折叠到主干的一次前向传递中。经过大规模现实世界数据的训练和验证,X-Mind 实现了具有竞争力的端到端驾驶性能,这使其成为一种高度实用、低延迟的解决方案,可以成功地将大规模认知推理直接部署到资源有限的车辆平台上。