论文

FIERCE:通过进度-失败反馈从通才机器人政策到快速专家

FIERCE: From Generalist Robot Policies to Fast Specialists via Progress-Failure Feedback

模型训练强化学习

摘要

通才机器人策略提供了有用的初始化,但通过有限的物理交互来完善紧凑的专家需要信息丰富的学习反馈。我们提出了 FIERCE,一个通才初始化的强化学习框架,以统一的、任务自适应的进度-失败评估器为中心。其架构在观察进度头和动作条件潜在预测器之间共享观察语言表示,该预测器过去和当前的预测为因果序列头提供任务失败估计。来自进度和偏好标签、同步命令和观察以及最终结果的联合监督训练评估者;目标任务执行轨迹支持适应和校准。固定评估器快照提供进度塑造和失败风险惩罚以及独立验证的终端奖励,而评估器和策略更新随着新经验的收集而交替。细化既不需要持续的通才动作查询,也不需要专用的目标任务模拟器或手动注释的密集奖励。部署时仅保留紧凑型专家。该评估将模拟和两个接触丰富的真实任务中的反馈质量、策略学习效率和部署成本分开。代码、模型权重和数据恢复工具在 https://github.com/ar-mine/FIERCE 上发布。