论文

REDIRECT:用 1% 更新预算修复机器人不良习惯

REDIRECT: A 1% Fix for Bad Robot Habits

模型训练监督微调与指令调优

摘要

机器人可能会从原本有用的远程操作中的一些缺陷时刻养成坏习惯。在混合质量的机器人数据中,正常和有问题的演示共享大多数任务行为,仅在局部动作延续方面有所不同。完全重新训练的成本很高,而仅在干净数据上的微调在较小的更新预算下提供有限的恢复。我们询问是否可以仅用完整训练样本向后预算的 1% 来修复局部差异。仅使用情节级保留/有问题的标签,REDIRECT 定位行为分歧,为其周围的原始观察分配连贯的保留延续,并锚定共享行为,无需帧级注释或额外交互。在三个随机 ManiSkill 任务和三个种子中,REDIRECT 将平均成功率从 68.2% 提高到 90.3%,恢复了 88.8% 的干净再训练差距,而匹配计算微调的恢复率为 22.1%。在 PiPER 手臂上,它可以恢复杯子插入和毛巾折叠过程中仅清洁间隙的 86.7-92.9%。因此,可以通过将更新预算花在行为差异上而不是重新学习共享行为来修复本地机器人习惯。

REDIRECT:用 1% 更新预算修复机器人不良习惯的原论文方法或结果图
图 1:1% 工作点的重定向概述。 (a) 保留的和有问题的演示共享一个前缀,然后在分支 $b$ 处分叉为保留的和失败的延续。 (b) 示意图:重定向提取运动转换候选者,使用运动学和 RGB 检索可比较的保留未来,定位干净校准的未来动作偏离中的最大上升,选择一个连贯的保留延续,并执行编辑/保留锚定的本地更新。 (c) 在 ACT 真实机器人杯子插入中,重定向将 $\theta_{0}$ 的成功率从 5/20 提高到 18/20,在 20/20 时接近仅清洁,同时需要 176.3 秒的优化时间,而完整的训练则需要 13,645 秒 (1.29%)。