论文
Realtime-VLA FLASH:基于扩散的 VLA 的推测推理框架
Realtime-VLA FLASH: Speculative Inference Framework for Diffusion-based VLAs
摘要
基于扩散的视觉语言动作模型(dVLA)在体现智能方面很有前景,但由于完全推理的高延迟,在实时部署方面从根本上受到限制。我们提出了 Realtime-VLA FLASH,这是一种推测性推理框架,通过引入轻量级草稿模型,通过主模型的 Action Expert 进行并行验证,并在需要时恢复到完整推理管道的阶段感知回退机制,消除了重新规划期间的大多数完整推理调用。这种设计可实现低延迟、高频率的重新规划,而不会牺牲可靠性。实验表明,在 LIBERO 上,FLASH 通过将许多 58.0 毫秒的完整推理回合替换为快至 7.8 毫秒的推测回合,将任务级平均推理延迟降低至 19.1 毫秒(加速 3.04 倍),从而在很大程度上保留了任务性能。我们还展示了现实世界中传送带分拣的有效性,强调了其对延迟关键的具体任务的实际影响。