论文
边理解边行动:实时视觉-语言-动作模型的异步语义-动作解耦
Acting While Understanding: Asynchronous Semantic-Action Decoupling for Real-Time Vision-Language-Action Models
摘要
视觉-语言-动作模型(VLA)在机器人操作中表现出了强大的任务理解和泛化能力,但全模型推理的高计算成本限制了它们在低延迟、高频闭环控制中的部署。我们提出了一种异步语义动作解耦框架,该框架沿着现有 VLA 的内部语义动作接口将语义理解与动作生成分开,而无需重新设计视觉语言主干或引入外部规划器。低频理解模块异步更新可重用的语义条件,而高频动作模块持续输出控制动作,而无需重复调用完整模型。为了减轻过时语义和当前执行状态之间的时间不匹配,我们进一步引入历史动作调节和时间错位训练,它们提供短时域执行上下文并提高过时语义条件下反馈控制的鲁棒性。在使用 $π_{0.5}$ 和 UniVLA 的 LIBERO 上进行的实验,以及使用 UniVLA 的真实机器人部署表明,所提出的框架实现了高达 35.6 Hz 的服务器端动作模块推理吞吐量,并提供了一条通往高频闭环控制的低入侵路径,而无需在控制速率下运行完整的 VLA 推理。