论文
XCoT-VLA:面向视觉-语言-动作驾驶的可执行思维链
XCoT-VLA: Executable Chain-of-Thought for Vision-Language-Action Driving
摘要
视觉-语言-动作(VLA)模型能够将场景理解、语义推理与轨迹生成连接起来服务于自动驾驶。然而,冗长的自然语言思维链(CoT)不适合实时控制,因为它是开放式的、解码成本高,且作为面向动作的表示难以优化。我们提出XCoT-VLA,用从自动构建的“推理-动作”监督中学到的紧凑可执行CoT token取代描述性理由。记录的轨迹提供动作证据,场景上下文提供因果语义。预测的XCoT序列保留在上下文中,并通过共享的多模态自注意力对固定轨迹查询进行条件化。确定性的token-函数路由将Reason FFN应用于XCoT token,将Control FFN应用于轨迹查询,以进行流匹配轨迹生成。我们进一步提出XCoT策略优化(XCPO),作为同一可执行token空间中的可选精炼扩展。XCoT-VLA在通用分布集上将纵向ADE从1.645降至1.323,在变道场景中将横向FDE从1.616降至0.648。通过仅用2-6个可执行XCoT token表示面向驾驶的推理,我们的方法大幅降低了自回归推理开销,并保持在实时规划预算之内。这些结果表明,面向驾驶的推理可以是紧凑、可执行且直接连接到轨迹生成的。
