论文
学习和转移闭环机器人软件
Learning and Transferring Closed-Loop Robot Software
摘要
闭环机器人策略需要观察处理、状态管理和依赖于情况的分支,这使得手动设计和调整成本高昂。尽管编码代理越来越多地支持控制代码生成和优化,但仍不清楚源任务的实现改进是否也支持新任务的策略获取。我们通过将完整的闭环实现视为可重用的执行体验来研究这个问题。对于每个源任务,编码代理从一些成功的演示中生成策略代码,并使用模拟反馈迭代改进它。验证选择的实现保留在软件档案中。对于新任务,代理使用存档的实现、目标演示和执行反馈来生成和改进策略。然后,生成的策略将被冻结并执行,无需进一步的模型调用。在 RoboCasa 的四个源任务中,迭代优化将平均成功率从 28.3% 提高到 64.2%。在 9 个目标任务和 3 次独立运行中,没有参考的平均成功率为 45.2%,使用初始源代码的平均成功率为 41.5%,使用优化源代码的平均成功率为 57.0%。在九个任务的平均值上,优化参考在所有三轮运行中均优于初始参考,平均增益为 15.6 个百分点。这些结果证明了执行改进软件作为在此设置中获取新策略的资源的价值,尽管在运行期间平均时,两个目标任务的初始参考仍然更好。