论文

WAM-Diff2:用于高效自动驾驶 VLA 的分层 AR 到扩散 蒸馏

WAM-Diff2: Hierarchical AR-to-Diffusion Distillation for Highly Efficient Autonomous Driving VLA

摘要

视觉-语言-动作(VLA)模型已成为端到端自动驾驶的重要范例;然而,它们的有效部署受到高计算延迟和顺序自回归解码引起的曝光偏差的严重限制。相反,虽然专门的扩散策略可以实现低延迟、并行执行,但从头开始训练它们通常会产生狭窄的单任务架构,缺乏整体视觉语言推理。成功地将预先训练的自回归通才转变为并行扩散模型可以将多任务认知智能与执行效率结合起来,但由于注意力模式不匹配(因果与双向)和不同的优化目标,这种转变带来了巨大的架构挑战。为了弥合这一鸿沟,我们引入了 WAM-Diff2,这是一种由三阶段分层 蒸馏 策略提供支持的多任务离散扩散 VLA 框架。通过渐进式块式适应、块式 蒸馏 和模型式跨尺度 蒸馏 来构建架构转变,WAM-Diff2 保留了基本模型的底层语义基础,同时加速推理。对驱动理解、感知和规划基准的广泛评估表明,WAM-Diff2 有效地减轻了暴露偏差,并实现了与自回归基线相当的性能。至关重要的是,自回归到扩散的过渡可实现 2.8 倍的解码加速,与 FlashInfer 和 CUDA Graph 等系统级优化相结合时,可扩展至最终的 15.1 倍加速。