论文

通过局部恢复监督实现 Visuomotor 策略的递归自我改进

Recursive Self-Improvement of Visuomotor Policies through Local Recovery Supervision

模型训练监督微调与指令调优

摘要

Visuomotor 策略可以执行熟悉的任务,但缺乏在自己犯错后所需的纠正行为。我们提出了一个通过本地恢复监督进行递归自我改进的框架。每轮都会审核当前的策略,在支持的故障状态下生成纠正演示,并使用它们来更新驱动下一轮收集的策略。离线审核员使用粗略和密集的时间证据来定位未解决的故障,并指定可观察的修复目标。固定多模态智能体充当使用教师模型的工具,通过观察、计算、执行和反馈生成恢复动作。冻结的学生模型测试每个教师模型端点是否支持进一步的进度。如果继续失败,系统将恢复该端点并扩展演示。然后,操作级质量评估定义连续的训练窗口,其中包含对齐的观察结果、质量权重和有效性掩模。仅部署学生模型。在一项初步的 LIBERO-Goal 研究中,恢复增强型后训练在 100 个验证场景中成功实现了 88 个场景,而来自同一 $π_0$ 检查点的原始数据延续则成功实现了 78 个场景。较早的一项关于仿机器人 Can 的 BC-RNN 研究使用 26 个局部恢复段将成功率从 102/130 提高到 112/130。两次比较都匹配 2,000 个额外的优化步骤。

通过局部恢复监督实现 Visuomotor 策略的递归自我改进的原论文方法或结果图
图 1:通过本地恢复监督实现递归策略改进。证据决定在哪里进行干预;冻结的学生模型的执行决定了教师模型必须演示多远;过渡质量决定了训练使用哪些连续间隔。失败的学生模型分支提供诊断证据,而仅接受的教师模型操作提供恢复标签。在后训练之后,更新的学生模型提供下一次审计,关闭外循环。 教师模型重量保持固定。机器人缩略图是合成方法插图。