论文

vla.cpp:视觉-语言-动作模型的统一推理运行时

vla.cpp: A Unified Inference Runtime for Vision-Language-Action Models

AI 基础设施模型服务框架

摘要

在机器人上部署视觉-语言-动作 (VLA) 模型需要使特定于模型的推理管道适应异构处理器和有限的板载内存。我们提出了 vla.cpp,这是一个适用于 11 个 VLA 模型的统一 C++ 推理运行时,模型执行不依赖于 PyTorch。运行时共享模型加载、张量执行和服务,同时保留特定于架构的注意力、调节和操作头。迭代策略在求解器步骤中重用依赖于观察的计算,而回归策略直接预测操作。我们评估了 LIBERO-Object 任务的成功情况,并分析了 NVIDIA、Apple 和 Intel 硬件上支持的配置。 BitVLA 在 8 GB Jetson Orin Nano 上完成了 200/200 LIBERO-Object 剧集。与 RTX 3060 和 AGX Orin 上的 CUDA 核心基准相比,三元张量核心内核将其客户端推理速度提高了 $4.0$--$4.6\times$。 SmolVLA 案例研究将位置索引精度与夹具命令和任务成功联系起来,展示了为什么固定输入数值检查应伴随执行轨迹评估。在 UR10e 和 ALOHA 上的部署展示了物理机器人集成;延迟和执行范围研究表征了同步分块控制。结果展示了跨 VLA 架构和硬件的通用部署路径,并通过数值验证和控制设置指导部署以及推理效率。