论文

StreamingVLA:具有动作流匹配和自适应早期观察的流式视觉-语言-动作模型

StreamingVLA: Streaming Vision-Language-Action Model with Action Flow Matching and Adaptive Early Observation

模型推理推理加速

摘要

视觉-语言-动作(VLA)模型在自然语言驱动的感知和控制方面表现出了卓越的性能。然而,VLA 模型的高计算成本带来了巨大的效率挑战,特别是对于现实部署中资源受限的边缘平台。然而,由于VLA的不同阶段(观察、动作生成和执行)必须顺序进行,并等待前一阶段的完成,导致系统频繁停机和高延迟。为了解决这个问题,我们进行了系统分析,以确定快速流畅生成的挑战,并建议使 VLA 能够以“流”方式跨 VLA 阶段异步并行化。首先,我们消除了对动作分块的依赖,并采用动作流匹配,它学习动作流的轨迹,而不是对分块动作进行去噪。它与动作生成和执行的延迟重叠。其次,我们设计了一种动作显着性感知自适应观察机制,从而重叠执行和观察的延迟。 StreamingVLA在不牺牲性能的情况下,实现了大幅加速,提高了执行的流畅度。它实现了 2.4 $\times$ 延迟加速,并将执行暂停减少了 6.5 $\times$。