论文
Hi-WM:可扩展机器人的人类世界模型 后训练
Hi-WM: Human-in-the-World-Model for Scalable Robot Post-Training
摘要
后训练 对于将预训练的通用机器人策略转变为可靠的特定于任务的控制器至关重要,但现有的人机循环管道仍然与物理执行相关:每次校正都需要机器人时间、场景设置、重置和现实世界中的操作员监督。与此同时,以行动为条件的世界模型的研究主要用于想象、合成数据生成和策略评估。我们提出 \textbf{Human-in-the-World-Model (Hi-WM)},这是一个 后训练 框架,它使用学习的世界模型作为可重复使用的纠正基础,以实现针对失败的策略改进。策略首先在世界模型内闭环采样执行轨迹;当执行轨迹出现错误或可能失败时,人类会直接干预模型以提供简短的纠正措施。 Hi-WM 缓存中间状态并支持回滚和分支,允许将单个故障状态重复用于多个纠正延续,并对基本策略处理不佳的行为进行密集监督。然后将所得的校正轨迹添加回 后训练 的训练集中。我们在涵盖刚性和可变形对象交互的三个现实世界操纵任务以及两个策略主干上评估 Hi-WM。 Hi-WM 与基本策略相比,在现实世界中的成功率平均提高了 37.9个百分点,与世界模型闭环基线相比,平均提高了 19.0个百分点,而世界模型评估与现实世界的绩效密切相关 (r = 0.953)。这些结果表明,世界模型不仅可以用作生成器或评估器,还可以作为可扩展机器人 后训练 的有效校正基底。