论文

用于自动驾驶中高效视觉-语言-动作模型的推理感知 推测解码

Reasoning-aware Speculative Decoding for Efficient Vision-Language-Action Models in Autonomous Driving

模型推理投机采样

摘要

自动驾驶的现代视觉-语言-动作(VLA)规划器在产生轨迹之前发出因果链(CoC)推理步骤\emph{。推理是自回归的并主导推理延迟,而轨迹头是并行的且便宜。延迟是自动驾驶的操作限制,因此加速推理步骤是我们解决的核心问题。我们观察到 CoC 推理有两个本质上不同的需求:大多数词元继续按照自我轨迹历史自然遵循的常规设置,一小部分编码需要有关意外情况的新鲜视觉证据的承诺。我们将此推理分为两个专门的路径:一个 \emph{常规推理器},通过关注轨迹历史来处理可预测的延续;以及一个 \emph{deliberative Reasoner}(未经修改的 VLA 目标),它通过关注当前的视觉证据来处理新案例,使用 推测解码 框架作为两条路径如何协作的架构模板。与标准 推测解码 不同,我们的例程推理器并不是目标的较小复制品;两个推理者故意专门阅读提示的不同部分。我们提出了两种技术来实现这一点。首先,我们引入 \textbf{FlatRoPE},这是草稿中的 1D 旋转位置嵌入,它打破了目标 3D M-RoPE 的旋转对称性,将注意力从视觉标记转移到轨迹历史标记上。其次,我们引入 \textbf{动作感知 RL (AARL)},这是一个 后训练 阶段,它使用动作质量奖励和静态参考 KL 锚点。相对于原始 Alpamayo 规划器,我们的双推理器系统将推理步骤运行时间减少了大约 4 倍。