论文
系统探索 GPT-6 Astra 作为具身策略的能力
Systematically Exploring the Capabilities of GPT-6 Astra as Embodied Policies
摘要
GPT-6 Astra 展示了生成数字机器人动作的卓越能力,将其作用扩展到高层规划之外。为了评估 Astra 作为通用具身策略的能力,我们在六个领域进行了全面评估,检查直接控制、与学习政策的合作以及反馈驱动的适应。在抓手操纵中,Astra可以修正任务目标,并为后续策略执行准备接触条件; π0.5 的混合控制在评估的 RoboDojo 子集上取得了 48% 的成功。在灵巧操作方面,混合控制在 10 次经验引导的 DexJoCo 试验中取得了 50% 的成功,而直接手控则难以协调手指接触。在移动操控方面,混合控制在评估的 RoboCasa365 上达到了 38.7% 的成功率。在导航方面,Astra 领先我们的本地比较,在 RxR 指令遵循上达到 92% 的成功率,在 HM3D 对象搜索上达到 82% 的成功率,尽管搜索会走很多弯路。在运动中,密集的运动参考生成仍然不可靠:尽管稳定性和前进进度有所改善,但在单个障碍路线上进行的五次连续尝试都没有达到目标。在人形机器人控制方面,Astra 在使用预先训练的全身控制器的 30 个 HumanoidBench 任务中,有 13 个任务超过了基准方法。这些发现揭示了有用的任务决策和可靠的物理控制之间的差距。推理延迟进一步限制了实际控制:在每个条件 50 个 RoboDojo 实例中,策略辅助和直接控制消耗 6.248 亿和 11.32 亿个词元。 30 秒的运动运行需要 250 次模型调用,平均每次调用 39.86 秒,推理过程中物理会暂停。