论文

EcoVLA:实时约束下面向视觉-语言-动作模型的节能端边协同推理

EcoVLA: Energy-Efficient Device-Edge Co-Inference for Vision-Language-Action Models under Real-Time Constraints

AI 基础设施模型部署

摘要

视觉-语言-动作(VLA)模型已成为具身智能的重要基础,但其高昂的推理成本给机器人系统部署带来重大挑战。实践中,端侧推理受限于有限的算力与能量预算,难以同时满足实时控制与能效要求;而将推理负载卸载到边缘服务器又易受系统状态波动影响,带来不可预测的延迟风险。端边协同推理是一种有前景的方案,但针对VLA模型的系统化研究仍然稀缺,尤其是能同时处理实时约束与系统级能效的统一协同推理框架。为此,我们提出EcoVLA,一个面向VLA模型的自适应端边协同推理框架,在实时约束下最大化系统能效。EcoVLA首先对不同VLA范式引入统一的阶段级抽象,建立与架构无关的协同推理设计空间;然后构建联合建模设备-边缘-网络延迟与能耗的预测模型,从而快速评估候选协同推理方案;在此基础上,EcoVLA以毫秒级开销持续选择满足实时约束的能效最优方案,适应网络与系统状态的运行时变化。此外,EcoVLA为阶段间中间张量设计了轻量传输机制,以降低跨设备协作带来的通信开销。跨VLA模型的实验表明,在20 Hz动作输出频率约束下,EcoVLA相比现有协同推理方法将系统能效提升最高236%,并在动态网络与边缘负载条件下持续保持SLO达标。

EcoVLA:实时约束下面向视觉-语言-动作模型的节能端边协同推理:论文配图
图1:EcoVLA 的挑战与动机。