论文

XCoT-VLA:面向视觉-语言-动作驾驶的可执行思维链

XCoT-VLA: Executable Chain-of-Thought for Vision-Language-Action Driving

模型训练监督微调与指令调优

摘要

视觉-语言-动作(VLA)模型能够将场景理解、语义推理与轨迹生成连接起来服务于自动驾驶。然而,冗长的自然语言思维链(CoT)不适合实时控制,因为它是开放式的、解码成本高,且作为面向动作的表示难以优化。我们提出XCoT-VLA,用从自动构建的“推理-动作”监督中学到的紧凑可执行CoT token取代描述性理由。记录的轨迹提供动作证据,场景上下文提供因果语义。预测的XCoT序列保留在上下文中,并通过共享的多模态自注意力对固定轨迹查询进行条件化。确定性的token-函数路由将Reason FFN应用于XCoT token,将Control FFN应用于轨迹查询,以进行流匹配轨迹生成。我们进一步提出XCoT策略优化(XCPO),作为同一可执行token空间中的可选精炼扩展。XCoT-VLA在通用分布集上将纵向ADE从1.645降至1.323,在变道场景中将横向FDE从1.616降至0.648。通过仅用2-6个可执行XCoT token表示面向驾驶的推理,我们的方法大幅降低了自回归推理开销,并保持在实时规划预算之内。这些结果表明,面向驾驶的推理可以是紧凑、可执行且直接连接到轨迹生成的。

XCoT-VLA:面向视觉-语言-动作驾驶的可执行思维链:论文配图
图2:离线XCoT训练数据构建流水线。记录的未来轨迹提供纵向与横向动作证据,而场景上下文提供与导航、规则、交互和安全相关的原因。随后,所选的理由-动作(Reason–Action)对被映射为规范的XCoT序列。