论文

迈向实时 VLA:阶段感知两步流去噪和系统级评估

Toward Real-Time VLAs: Stage-Aware Two-Step Flow Denoising and System-Level Evaluation

模型推理推理加速

摘要

视觉-语言-动作 (VLA) 模型面临低速推理和高速机器人执行之间的时间差距。我们通过模型推理和机器人执行链的端到端延迟测量来表征这一差距。重复流匹配去噪极大地增加了推理成本,而机器人端延迟主要来自感知获取、通信调度和物理响应。速度场分析显示,早期积分中速度场的大小和方向相对稳定,随后在末端台阶附近出现更强的方向校正。基于该阶段的异质性,我们提出两阶段非均匀去噪,将步骤数从 10 减少到 2,并将模型推理时间从 61.557 ms 减少到 21.956 ms。我们还开发了一个分布式实时 VLA 框架,具有独立推理、动作发布和机器人控制速率、模块化观察采集和动作来源记录。使用 π0.5 作为基线,我们评估了长期物理折叠任务的六种实时执行方法。 Legato 在基于训练的方法中总体表现最好,而 Temporal Smoothing 在无训练的方法中领先;两者在任务成功率、完成时间、动作连续性和加速平滑度方面都表现出色。将两步去噪与代表性执行方法相结合可显着降低推理成本,同时任务性能略有下降。这些结果促进了模型推理效率和机器人系统时序的联合优化。