论文
Embodied.cpp:异构机器人上的嵌入式 AI 模型的便携式推理运行时
Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots
摘要
实体人工智能模型现在涵盖了视觉语言动作(VLA)模型和世界动作模型(WAM),但实际部署在特定于模型的Python堆栈、后端假设和机器人端粘合代码方面仍然支离破碎,尤其是在异构边缘设备上。现有的推理运行时主要是为请求-响应服务而设计的,因此不满足体现部署的运行时契约:闭环控制内的多速率执行、异构硬件上的延迟优先批量1推理以及超出固定词元I/O的可扩展体现接口。我们提出了 Embodied$.$cpp,一个用于体现模型的可移植 C++ 推理运行时。基于对代表性 VLA 模型和 WAM 的架构分析,Embodied$.$cpp 捕获共享执行路径并将其组织为五层:输入适配器、序列构建器、骨干执行、头插件和部署适配器。该运行时提供模块化多速率执行、延迟优先融合推理以及可扩展的运算符和 I/O 支持,从而能够通过一个后端抽象跨异构设备、机器人和模拟器进行部署。我们使用 Python 和 C++ 量化配置之间的标准化比较,在三个 VLA 和两个 WAM 模型上评估 Embodied$.$cpp。总体而言,相对于 Python 基线,Embodied$.$cpp 实现了 1.05 倍-2.70 倍的推理加速和 7\%-77\% 的 VRAM 降低,同时在大多数配置上保持了接近基线的成功。这些结果表明,Embodied$.$cpp 提高了部署效率,同时在不同的体现模型架构中保持了高控制质量。项目链接:https://github.com/SEU-PAISys/Embodied.cpp