论文
PhysEvo:冻结模型持续改进机器人工具与技能
PhysEvo: Astra Can Act, Let It
摘要
阿斯特拉可以行动,但可靠的操纵取决于它观察和控制世界的系统。我们介绍 PhysEvo,这是一个围绕单个冻结模型进行物理递归自我改进 (RSI) 的框架。任务Agent执行机器人任务;元Agent使用生成的轨迹来诊断故障、修改工具和技能以及测试更正。元Agent还可以改进自己的诊断工具,因此保留的修订支持以后的行动和以后的自我改进。该过程开发联合级控制、寻求证据的观察和可重复使用的操作技能,而无需模型权重更新或单独训练的行动策略。在 42 个 RoboDojo 任务中,保留的特定于任务的部署版本的保留布局评估产生了 68.14/100 的五维平均得分和 62.00% 的成功率,而 RoboDawn 的一次性 Astra Agent的成功率为 47.17%,这是我们比较中最强的已发布参考。在挑战直接 Astra 的八项操作任务中,PhysEvo 取得了 55.00% 的成功率,而直接 Astra 参考的成功率为 1.25%。在 AgileX PiPER 上部署模拟演进的工具并持续进行技能修订,在针对五项实际任务的 25 次试验中获得了 90.60/100 的平均分和 84.00% 的成功率。 PhysEvo 将行动的后果转化为对冻结模型如何行动和改进的持久、可测试的改变。
