PhyAI:边缘实时物理AI与云端可扩展采样
PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud
摘要
物理AI策略在整个生命周期内需要进行推理,包括模型评估、云端强化学习采样、边缘GPU服务和本地部署。尽管这些设置共享相同的检查点和动作语义,但它们通常依赖于不同的推理程序。为了统一它们,我们构建了PhyAI,一个具有单个运行时的物理AI推理引擎,该引擎将架构特定的条件、求解器、缓存和输出逻辑封装在模型适配器中,同时共享图执行、内核、内存管理以及并行服务。相同的代码库可以在机载、边缘和云端部署中的单GPU或多GPU上运行视觉-语言-动作(VLA)模型和世界-行动模型(WAMs)。我们使用适配接口在发布当天添加了MiniCPM-Robot。PhyAI相对于官方实现的pi0、pi0.5、GR00T N1.7和MiniCPM-Robot,实现了1.40x至4.65x的速度提升。在Cosmos3-Nano-Policy-DROID上,将延迟在八张H20 GPU上从2.46秒降低到1.18秒(CFG=2, TP=4),这是一个2.08x的性能提升。在某些配置下,专门的运行时仍然更快,因此我们的目标是有一个具有竞争力延迟的单一运行时,而不是每个情况下都达到最快的性能。详细的性能分析揭示了不同模型需要不同的执行策略:在一张Hopper系列GPU、批大小为1时,pi0.5行动专家占用了8.8%的FLOPs但占用了57.2%的延迟;在批次大小为32的情况下,其份额下降到13.5%,吞吐量达到每秒约100个样本。Cosmos3仍然以生成为主,并且随着批次大小从1增加到16,吞吐量增加了14.3%。我们进一步引入了控制时间的Roofline,它区分了受推理瓶颈限制的控制与受环境瓶颈限制的控制;在四套LIBERO测试集中测量的pi0.5受环境瓶颈限制,而Cosmos3仍受推理瓶颈限制。代码和基准:https://github.com/mingti-org/phyai
