论文

用具身Agent编排弥合通用机器人的能力差距

Addressing the Orchestration Gap in Generalist Robots via Physical Agency

智能体系统Agent 架构与控制循环

摘要

通用机器人需要结合感知、世界知识、规划、成功检测、恢复和底层控制来推理其行为。当今最先进的模型试图通过大规模 预训练 将所有这些功能结合到学习策略中。相反,我们表明这些功能可以分解为通用语言条件的策略/控制代理和高层代理管理器/编排器。我们不是通过 预训练 训练策略进行推理,而是构建一个闭环具身智能体协调器,它可以进行高层规划、将目标分解为可实现的子目标、指挥底层运动命令、跟踪和验证底层观察的结果以及从故障中恢复。我们的具身智能体协调器 (Pigey) 可以控制现有的视觉-语言-动作 (VLA) 策略以及参数化技能来解决现实世界中的复杂推理任务,而无需任何额外的数据收集或 后训练。我们在模拟基准和具有挑战性的现实世界机器人操作任务中广泛评估了 Pigey,并展示了相对于现有通用策略的显着性能改进。在 LIBERO-PRO 上,Pigey 将最先进技术提高了 4 倍以上 (12.8% -> 53.3%),并且没有特定于任务的 微调。在真实的机器人上,Pigey 在推理受限任务上将冻结策略从接近零提升到 90% 以上。我们将单独实现的冻结运动技能与在代理循环内实现的冻结运动技能之间的差异称为编排差距。