论文

BlockVLA:通过块扩散微调加速自回归 VLA

BlockVLA: Accelerating Autoregressive VLA via Block Diffusion Finetuning

模型推理推理加速

摘要

虽然自回归 (AR) 视觉语言动作 (VLA) 模型在机器人任务中展示了强大的推理能力,但其顺序解码过程通常会产生较高的推理延迟,并且可能会放大长视野执行期间的错误累积。离散扩散语言模型 (dLLM) 通过并行标记细化提供了一种有前途的替代方案,但它们在机器人技术中的实际部署仍然受到重复去噪函数评估 (NFE) 以及直接将标准 KV 缓存应用于双向迭代解码的困难的限制。为了弥合这些范式,我们提出了 BlockVLA,这是一个通过块扩散范式将预训练的 AR 主干调整为有效的离散扩散策略的框架。 BlockVLA 在块级别保持自回归依赖性,同时在每个块内启用并行去噪,从而将全局因果一致性与局部并行生成相结合。这种设计可以实现跨已完成块的前缀 KV 缓存重用,降低迭代去噪的有效成本,并提供从 AR 预训练到基于扩散的策略 微调 的更平滑过渡。我们对 LIBERO 和 SimplerEnv 基准进行了广泛的评估。实验结果表明,我们的 BlockVLA 比标准离散扩散基线实现了 3.3$\times$ 推理加速。此外,我们的模型表现出卓越的训练效率,成功率收敛速度比基线快得多,这种增益在复杂的长期任务中尤其明显,其中 BlockVLA 在训练的早期阶段实现了显着的性能提升。这项工作将 Block Diffusion 建立为大规模预训练 AR 模型与高效、高频实时机器人控制之间的坚固桥梁。