论文
Fast-dDrive:用于自动驾驶的高效块扩散 VLM
Fast-dDrive: Efficient Block-Diffusion VLM for Autonomous Driving
摘要
通过视觉-语言-动作(VLA)模型的端到端自动驾驶需要在高保真轨迹规划和高效推理之间取得不稳定的平衡。现有范例通常存在不足:自回归 (AR) VLA 在边缘硬件上受到内存带宽限制,容易出现曝光偏差漂移,而全序列扩散模型则排除了 KV 缓存重用,并遭受“逻辑泄漏”,违反了基本的感知然后计划因果关系。我们提出了 Fast-dDrive,这是一种块扩散 VLA,它在语义单元内执行双向细化,同时在它们之间强制执行严格的因果排序。利用驱动 VLA 经常发出类似 JSON 的结构化输出的观察结果,Fast-dDrive 将结构词元冻结到部分支架中,并采用优先考虑安全关键规划的部分感知训练方案。我们进一步引入 Scaffold 推测解码,以显着提高的吞吐量实现 AR 同等质量。最后,我们提出了一种低开销的测试时间扩展方案:通过从单个共享前缀 KV 缓存中分叉 $N$ 随机轨迹采样轨迹并对它们进行平均,我们以分数计算成本有效地抑制了预测方差。实证结果表明 Fast-dDrive 重新定义了驾驶代理的速度准确度边界。在 WOD-E2E 测试集上,Fast-dDrive 实现了 SOTA ADE@3s 和 ADE@5s,以及基于扩散的 VLA 中最高的 RFS;在 nuScenes 上,它将平均 L2 误差降低至 $0.32$m(改进了 $22\%$)。当与 SGLang 集成时,我们的框架可在 AR 基准的基础上提供 12 倍的吞吐量加速,缩小大容量 VLA 与实时车载部署的效率需求之间的差距。