论文

学习超越人类所能展示的内容

Learning Beyond What Humans Can Demonstrate

智能体系统Agent 动作执行与治理

摘要

机器人操作的行为克隆依赖于专家的演示。然而,对于需要动态稳定性、精确接触时间或灵巧协调的任务,人类操作员可能会发现很难甚至不可能收集数据。我们研究了这种不可行的演示机制,并提出了 GLIDE:有效学习不可行演示的护栏,这是一个推断特定任务的故障模式并将其转换为用于数据收集和策略部署的可执行护栏的框架。给定任务描述和调节遥操作代码,GLIDE 编写护栏,使用系统状态来过滤遥操作和策略命令,限制容易失败的操作,并根据轨迹反馈迭代改进。在三项任务中,GLIDE 发现了超越领域专家硬编码护栏的紧急护栏,改进了简单 VR 远程操作和领域专家硬编码护栏的数据收集。经过改进后,GLIDE 将这三项任务的数据收集成功率从 0-10% 提高到 70-90%。在策略执行过程中,混合数据保护策略在番茄盘转移、标记移交和摊位以及葡萄酒服务任务上分别达到 70%、60% 和 60% 的成功率。这些结果表明,当直接演示不可行时,GLIDE 可以支持政策学习。项目网站:这个http URL