论文
FlashDrive:面向自动驾驶的快速视觉-语言-动作推理
FlashDrive: Flash Vision-Language-Action Inference for Autonomous Driving
摘要
视觉-语言-动作(VLA)模型有望为自动驾驶带来端到端推理,但其计算成本对实时控制而言仍远超可承受范围。核心挑战是结构性的:VLA 推理不是单一瓶颈,而是四级瓶颈的级联。视觉编码在重叠的视频帧上浪费算力;语言模型预填充重复计算本可从上一时间步沿用的上下文;推理 token 尽管熵很低却仍被串行生成;流匹配去噪对非均匀的速度场施加均匀算力。孤立地处理任何一个阶段都无法顾及其余阶段。我们提出 FlashDrive,一个同时针对全部四个阶段的算法-系统协同设计框架。我们的关键洞察是:每个瓶颈都有各自独特的轻量算法捷径——时间重叠支持跨帧的流式 KV-cache 复用;驾驶领域推理的单 token 低熵和强块内相关性使非自回归扩散起草器在投机解码中极为高效;速度场“两端锐利、中间平坦”的结构允许自适应步长缓存,把算力集中到关键之处。在系统级 CUDA Graph 编译与核融合的加持下,这些技术相互叠加增效。结合 W4A8 量化应用于 Alpamayo 1.5-10B 时,FlashDrive 将端到端延迟从 717ms 降至 151ms(4.7 倍),而精度基本不变:minADE6@6.4s 仅偏移 0.08m,minADE1 有所改善,仿真中的闭环碰撞率和驶出道路率均有改善。通过在单 GPU 上把 10B 参数的推理型 VLA 从 1.4 Hz 提升到 6.6 Hz,FlashDrive 使端到端自动驾驶明显更接近实时部署。
