论文

ChainFlow-VLA:使用视觉语言模型进行因果流规划

ChainFlow-VLA: Causal Flow Planning with Vision-Language Models

模型架构混合架构

摘要

当前的端到端自动驾驶系统从根本上受到时间因果推理和全局轨迹一致性之间不匹配的限制。自回归 (AR) 模型通过因果分解捕获交互感知的时间依赖性,但其逐步解码会导致错误累积和次优全局结构。相比之下,扩散模型在全局范围内优化轨迹,但缺乏明确的因果约束,使得它们在交互和安全关键场景中不可靠。这种二分法揭示了一个更深层次的问题:现有方法将因果建模和全局优化视为单独的范例,没有一种原则性的方法将它们统一在单个轨迹分布中。为了解决这个问题,我们提出了 ChainFlow-VLA,它将因果生成和全局细化统一在一个统一的概率框架内。我们将规划制定为 AR 引发模式的混合,并学习这些模式上的视觉语言模型 (VLM) 条件残差分布。自回归生成器 (Chain) 生成一组离散的因果轨迹模式,然后是基于扩散的细化器 (Flow),它利用 VLM 隐藏状态作为语义先验,在残差空间中执行模式条件校正,同时保留因果结构。这种简单的调节将高级场景理解无缝地注入到细粒度的轨迹调整中。实验表明,ChainFlow-VLA 在模糊和长尾场景中实现了稳健的规划,在 NAVSIM v1 排行榜上取得了 94.85 的最先进分数,与人类水平的表现 (94.8) 相匹配。代码可在 https://github.com/AFARI-Research/ChainFlow-VLA 获取。