论文

表征跨 XPU 的视觉-语言-动作模型:机器人部署的约束和加速

Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment

模型推理推理加速

摘要

视觉-语言-动作(VLA)模型对于通用机器人控制很有前景,但在严格的成本和能源预算下,机器人部署受到实时推理的瓶颈。大多数先前的评估都依赖于桌面级 GPU,从而掩盖了异构边缘加速器(GPU/XPU/NPU)提供的权衡和机会。我们通过模型-硬件​​共同表征对低成本 VLA 部署进行了系统分析。首先,我们构建了一个跨加速器排行榜,并在 CET(成本、能源、时间)下评估模型-硬件​​对,表明尺寸合适的边缘设备可以比旗舰 GPU 更具成本/能源效率,同时满足控制率限制。其次,通过深入分析,我们发现了一致的两阶段推理模式:计算绑定的 VLM 主干,然后是内存绑定的 Action Expert,这会导致阶段相关的利用率不足和硬件效率低下。最后,在这些见解的指导下,我们提出 DP-Cache 和 V-AEFusion 来减少扩散冗余并实现异步管道并行性,在 GPU 上实现高达 2.9 倍的加速,在边缘 NPU 上实现 6 倍的加速,而成功率仅略有下降。示例排行榜网站位于:https://vla-leaderboard-01.vercel.app/。