论文

通过推测推理和验证实现高效 VLA 推理的算法架构协同设计

Algorithm-Architecture Co-Design for Efficient VLA Inference via Speculative Inference and Verification

模型推理推理加速

摘要

视觉-语言-动作(VLA)模型在实体人工智能领域展现了卓越的能力,但其高计算成本和有限的预测动作长度阻碍了实时部署。尽管已经推出了高效体现人工智能的专用加速器Dadu-Corki,但它没有利用机器人与其环境之间的固有交互模式,这导致预测动作长度相对较短。我们观察到,机器人环境自然地在活动状态(其中精确的行动至关重要)和非活动状态(其中行动对任务成功的影响有限)之间交替。这种洞察力带来了新的调度机会:非活动状态下的长动作长度推测预测,与活动状态下的选择性验证相结合。我们提出了 SpecVLA,一种算法系统协同设计框架,可以自适应地平衡动作长度、推理延迟和任务可靠性。在算法方面,SpecVLA 引入了状态感知 VLA 推理执行范例,以及使用差分残差和块级混合精度量化的硬件友好型较小验证模型 (sVLA) 构造。在系统方面,我们开发了一个由 GPU 和机器人专用硬件模块组成的异构架构,以及通过并行执行解耦 VLA 和 sVLA 的推测数据流。对 LIBERO 和 ManiSkill 基准的 OpenVLA 和 RDT 的综合评估表明,SpecVLA 显着降低了端到端延迟,同时保持了任务成功率。通过实现长动作长度推测预测并及时验证,SpecVLA 实现了高效可靠的实时机器人操作。