论文
AnchorVLA:为视觉-语言-行动规划桥接离散决策和连续轨迹
AnchorVLA: Bridging Discrete Decisions and Continuous Trajectories for Vision-Language-Action Planning
摘要
自动驾驶规划需要将导航意图、交通规则、动态交互和语言指令转化为可执行的连续轨迹。视觉-语言-动作模型已被引入驾驶规划中,以提高长尾泛化、常识推理、高级语义理解和可解释性。然而,现有的 VLA 规划器主要遵循基于规划头的轨迹预测或全轨迹自回归生成。前者仅弱约束VLA推理的连续轨迹生成,而后者依赖于低信息密度坐标标记的长序列,使得语义-动作对齐变得困难,并导致离散化错误和低效推理。为了解决这些限制,我们提出了 AnchorVLA,这是一种分层决策锚定的 VLA 规划框架,它使用轨迹模式锚作为高级 VLA 推理和连续轨迹执行之间的显式接口。具体来说,决策作为锚表示表示带有锚词元的行为级驾驶决策,每个锚词元编码整个局部运动模式而不是单个坐标点。然后,决策锚定残差流在选定的锚定残差空间中生成细粒度的连续轨迹,在高级决策制定后捕获多模式执行细化。通过对紧凑且语义有意义的锚进行推理,而不是自回归生成路点序列,AnchorVLA 保留了基于 LLM 的决策,同时提高了推理效率、语义动作对齐和连续生成灵活性。 Bench2Drive 闭环基准测试表明,AnchorVLA 实现了 77.28 的最先进成功率和 89.92 的有竞争力的驾驶分数。