论文
用最少的数据适应通用机器人策略
Adaptation of Generalist Robot Policies with Minimal Data
摘要
机器人学习的一个中心目标是超越特定任务的人类数据收集,转向通过自主交互进行改进的机器人。然而,在当前的政策下,完全自主的学习仍然很困难:稀疏的奖励和薄弱的零样本探索使得机器人不太可能从头开始发现成功的行为。我们研究最小数据适应,在这种机制中,预先训练的机器人策略必须从一次演示中学习一项新任务,然后进行自主在线交互。这种设置是完全自主改进的最容易处理的代理,使我们能够研究最少的人类指导是否可以引导自主学习,以及哪些算法成分使其可行。我们构建了 MiDAS,这是一个简单的离线到在线 RL 配方,它首先通过在单个/少数演示上进行行为克隆将预训练的 VLA 锚定到目标任务,然后通过基于价值的在线 RL 在剩余策略参数化上对其进行改进。在 LIBERO 和 RoboCasa 中,MiDAS 只需一次演示即可恢复强大的任务性能,大大超越基线,并超越演示条件。我们在双手 YAM 平台上进一步评估 MiDAS。从一次演示中获得的脆弱的低成功策略开始,MiDAS 提高了其稳健性,并在约 6 小时的在线交互中学习新的成功行为。据我们所知,这是首次通过单个任务演示来演示可靠的机器人策略适应。