论文
RoboPrompt:用稀疏人类输入引导机器人基础策略
RoboPrompt: Intuitive Robot Policy Steering with Sparse Human Input
摘要
通过模仿学习训练的端到端机器人策略受限于数据多样性,难以在真实环境中可靠地零样本部署。共享自治方法允许通过遥操作进行人工纠正,但专用硬件与操作人员培训妨碍规模化部署。其他方法把人工指导作为额外策略输入,通常需要修改架构并专门训练可控性,因而难以跨策略使用。我们提出RoboPrompt,一种通用、轻量的机器人策略引导系统,允许用户通过绘制轨迹、目标点和粗略方向等直观稀疏输入指导策略。RoboPrompt将人类意图转换与底层策略解耦:可复用模块把指导转成动作草案,再利用底座策略的扩散或流匹配动力学细化。系统在噪声空间控制动作生成,平衡人类意图与策略先验,无需修改底座架构或为可控性微调。实验显示,它能有效引导Diffusion Policy、π₀.₅和FastWAM。我们进一步通过DAgger使用引导后的Rollout在线改进策略。迭代2至3轮后,π₀.₅在三项任务上的平均成功率提高15.5%;三种策略在Insert Bread任务上的平均成功率提高21.3%。两种设置中的平均人工干预次数分别下降44.0%(2.86降至1.60)和81.9%(2.60降至0.47)。
