论文

CLIFT:通过非侵入性闭环迭代将设备上的 Gemini 机器人转变为人形专家 微调

CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Closed-Loop Iterative Fine-Tuning

模型训练监督微调与指令调优

摘要

虽然机器人基础模型的能力越来越强,但最强大的模型通常是在专有数据上进行训练的,并且仍然是闭源的,限制了下游用户使其适应新任务、实施例和部署设置的能力。继 LLM 社区之后,封闭权重机器人基础模型的新兴访问范例是托管监督 微调 (SFT) API,用户可以在其中提交训练数据并接收调整后的策略,而无需访问模型权重、梯度或训练内部结构。虽然此类 API 让下游用户利用强大的专有基础模型,但它们将策略改进限制为纯粹的模仿,排除了强化学习和其他依赖内部训练信号的闭环方法。这种限制对于敏捷、接触丰富的人形操纵来说尤其严重,由于新颖的状态、动作跟踪动态、延迟和特定于控制器的故障模式,策略输出和部署的行为之间的差距很大。我们研究了这种托管 API 机制对于人形适应的有效性,以及如何在其中实现闭环改进以推动策略走向任务掌握。我们对真正的人形机器人进行了托管 API 适应的首批实证研究之一,并在 Gemini Robotics On-Device (GROD) 上实例化。我们发现,通过 API 进行的直接 SFT 大大优于在相同演示中训练的领先开放权重 VLA,但在敏捷、接触丰富的任务上仍达不到部署级别的掌握程度。为了弥补这一差距,我们引入了 CLIFT:闭环迭代 微调,它将部署时奖励反馈转化为与 API 兼容的监督数据,并在不访问权重、梯度、可能性或损失的情况下实现闭环策略改进,从而在两个飞轮周期后将 GROD 推向近乎完美的成功,所有这些都无需“打开模型盒”。