论文
123轮机器人Agent自改进为何未完成目标任务
What Stops Recursive Self-Improvement in Robotics? Lessons from 123 Rounds of Agentic Skill Discovery
摘要
机器人能否像编程Agent改进软件那样自我改进?我们为此构建一个Agentic系统。它观察机器人失败,判断缺少的能力,编写新技能或寻找并安装外部模型,在仿真中测试每次变化,然后重复;没有人类编写机器人代码。我们在家庭操作任务上运行123轮改进,报告从中学到的经验。好的一面是,Agent能自行发现能力缺口:发现目标不在视野内后,它请求主动观察模型,调试并部署有效搜索技能。不好的一面是,这些改进没有累积成目标成功。变化不断通过测试,但把调味品放到冰箱最上层的目标始终未完成。我们发现,Agent本身很少是瓶颈,周围三个因素才是。第一,串联感知模块不理解关系:SAM 3等分割器能找到架子,却不理解“最上层架子”;Agent不断添加几何规则仍不收敛,而真正需要的是另一类模型。第二,技能链把学习锁在第一步:长任务多在早期失败,证据和修复集中在那里,后续技能很少被触达、测试或改进。第三,Agent学到什么由Harness决定:它精确优化评测器测量的内容,包括错误指标;弱测试和误导记忆使活动陷入停滞。我们将这些经验提炼为构建机器人自改进系统的具体建议,并为每条建议配一个可证伪实验。