论文

自主机器人政策改进的技能空间射击

Skill-Space Shooting for Autonomous Robot Policy Improvement

模型训练合成数据

摘要

部署在物理世界中的机器人在遇到新情况和故障时必须能够超越最初的训练进行改进。为了使这种改进能够跨任务扩展,它必须有效利用经验,而不需要人工演示每次纠正。最近的 Agentic 系统提供了一种方法,通过使用基础模型自主组合学习行为来完成任务,从而减少对人类工作的依赖。然而,以这种方式完成任务本身并不能教会任务策略克服其自身的失败;相反,它是一种任务策略。这需要将这些行为转化为可学习的政策修正。我们的见解是,许多此类修正都是熟悉的简短行为或技能:它们在任务中重复出现,并描述基础模型可以从场景中推理出的动作。我们引入技能空间射击,它使用基础模型指导,通过这些可重用的技能来探索修正,并将成功的尝试转化为政策改进。现实世界的实验表明,自主行动的政策不断得到改进,同时也可以共享技能,以减少改进新任务所需的教学。通过将可重复使用的技能作为纠正监督的来源,技能空间射击可以在任务内部和跨任务之间实现可扩展和可推广的策略改进。其他结果和视频请参见 https://skill-space-shooting.github.io.