论文
通过局部恢复监督实现 Visuomotor 策略的递归自我改进
Recursive Self-Improvement of Visuomotor Policies through Local Recovery Supervision
摘要
Visuomotor 策略可以执行熟悉的任务,但缺乏在自己犯错后所需的纠正行为。我们提出了一个通过本地恢复监督进行递归自我改进的框架。每轮都会审核当前的策略,在支持的故障状态下生成纠正演示,并使用它们来更新驱动下一轮收集的策略。离线审核员使用粗略和密集的时间证据来定位未解决的故障,并指定可观察的修复目标。固定多模态智能体充当使用教师模型的工具,通过观察、计算、执行和反馈生成恢复动作。冻结的学生模型测试每个教师模型端点是否支持进一步的进度。如果继续失败,系统将恢复该端点并扩展演示。然后,操作级质量评估定义连续的训练窗口,其中包含对齐的观察结果、质量权重和有效性掩模。仅部署学生模型。在一项初步的 LIBERO-Goal 研究中,恢复增强型后训练在 100 个验证场景中成功实现了 88 个场景,而来自同一 $π_0$ 检查点的原始数据延续则成功实现了 78 个场景。较早的一项关于仿机器人 Can 的 BC-RNN 研究使用 26 个局部恢复段将成功率从 102/130 提高到 112/130。两次比较都匹配 2,000 个额外的优化步骤。
