论文

vla.simd:针对语言条件操作的高效 CPU 推理

vla.simd: Efficient CPU Inference for Language-Conditioned Manipulation

AI 基础设施模型部署

摘要

在没有专用 GPU 的情况下部署语言条件操作需要有效的推理和操作块来覆盖策略查询之间的延迟。我们展示了这个 http URL,这是一个 CPU 推理引擎,它结合了共享 SIMD 微内核、可重用计算和特定于目标的优化。我们将查询延迟和执行范围与滞后和时间对齐执行下的操作可用性联系起来,区分操作供应和反馈频率。在六个策略和四个 CPU 中,此 http URL 比已编译的 PyTorch 引用实现了大约 $1.4\times$ 的中值加速,同时保留了 fp32 数字保真度。我们还引入了 IMPACT,这是一种基于 ACT 的策略,具有缓存文本表示和语言调制的视觉特征。 IMPACT 是我们评估集中唯一一个在 Raspberry Pi 5 上提供至少 30 个操作/秒的语言条件策略:经过 90 秒的热浸泡后,它在 fp32 中提供 33.5 个操作/秒,在 int8 中提供 81.2 个操作/秒。单独的 GPU 评估收益为 76.4\%$,意味着在没有机器人预训练的情况下,四个 LIBERO 套件都取得了成功;指令改组测试展示了在熟悉的目标中进行选择。在 SO-101 手臂上进行 IMPACT 试验,在带有 Robotiq 夹具的 UR10e 上进行 SmolVLA 试验,演示了两个机器人实施例上的 CPU 部署。