论文

VLA-ULAP:将云 VLA 调用与边缘的超轻量级本地动作预测交错

VLA-ULAP: Interleaving Cloud VLA Calls with Ultra-Lightweight Local Action Prediction at the Edge

模型推理推理加速

摘要

十亿参数的视觉-语言-动作(VLA)策略需要大量的机载电源,而远程推理中的通信延迟阻碍了及时响应。我们提出了 VLA-ULAP,它将远程 VLA 调用与超轻量级本地动作预测器 (ULAP) 交错。 ULAP 具有大约 740 万个参数(包括冻结视觉编码器),结合当前视图、本体感觉和执行的动作历史记录,一次性预测块。它经过独立训练,不需要 VLA 隐藏状态、在线验证或服务器往返。在 Jetson Orin Nano 上,ULAP 每次推理需要 19.9 毫秒和 0.183 J,而 RTX A6000 上的 GR00T 则需要 284.3 毫秒和 50.55 J。在三个模拟的基本策略/基准对中,选定的操作点消除了 48.8--76.7% 的 VLA 调用,同时保留了 95.0--97.5% 的基线成功率。与 VLA-JEPA 上的本地 VLA 加速替代方案相比,在成功率相当的情况下,与 ACT 相比,ULAP 在每次成功事件中使用的推理时间和 GPU 能量估计减少了 49.2%,GPU 能量减少了 51.0%;在相同的成功率下,ULAP 比 SP-VLA 减少了 77.1% 的时间和 79.9% 的能量。根据成功的片段调用计数和测量的设备成本,物理 SO-101 实验在已见和保留的放置中保留了 95.2--100\% 的基线成功率,同时将推理时间估计减少了 47.9--58.0\%,将推理设备能量减少了 52.1--62.5\%。更快的响应还提高了动态任务的成功率:在延迟感知的 LIBERO-Safety 模拟中,VLA-ULAP 在两项任务上分别超出 $π_{0.5}$ 11.0 和 15.5 个百分点,同时将 VLA 调用大约减半。