论文

FlashVLA:用于快速异步 VLA 推理的流式操作解码

FlashVLA: Streaming Action Decoding for Fast and Asynchronous VLA Inference

模型推理推理加速

摘要

视觉-语言-动作(VLA)模型对于机器人操作越来越有希望,但它们在现实世界中的部署仍然受到高推理延迟和不稳定的异步执行的瓶颈。这一挑战在基于流匹配的 VLA 模型中尤其明显,其中动作解码需要以 VLM 上下文为条件的多个迭代步骤。虽然高效的推理方法提高了控制频率,异步方法减少了执行空闲时间,但现有方法往往无法共同实现低延迟推理和准确、时间一致的异步执行。我们引入了 \textbf{FlashVLA},一个流动作解码框架,它以统一的形式解决了这两个挑战。 FlashVLA 维护一个具有不同噪声级别的多个块的流操作缓冲区,并使用逐块因果注意对它们进行解码。这一设计允许 FlashVLA 在每个推理步骤中生成一个可执行操作块。此外,其分块自回归公式隐式地保留了动作连续性,从而无需额外的未来状态条件即可实现平滑的异步执行。在广泛的模拟和现实实验中,FlashVLA 显着提高了推理速度,同时保持了强大的任务性能。它可以在单个 GPU 上实现 $\geq$30\,Hz 控制频率,并在实际部署中实现平滑的异步推理。