论文
VLCP:机器人操作的视觉语言控制策略闭环代码重新规划
VLCP: Vision Language Control Policy Closed-Loop Code Replanning for Robot Manipulation
摘要
将前沿视觉语言模型转变为机器人策略通常意味着 微调 它会发出在预训练中从未见过的动作表示,这抛弃了模型值得研究的大部分推理。我们采取相反的方式并保持 VLM 冻结。它将策略编写为一个简短的 Python 控制函数,没有演示,也没有 微调。不过,编写一次该代码是开环的。现有的闭环方法在错误的级别上做出反应:它们重试固定策略或选择不同的子任务,但从不重写失败的代码。 VLCP 在单个事件内关闭控制代码上故障实际存在的循环。每 $K$ 步,VLM 都会从多视图 RGB、本体感受状态和状态增量重新观察场景,然后根据刚刚看到的内容重写控制函数,以便在故障复合之前捕获故障。我们对 57 项任务的 MuJoCo/RoboVerse 扫描进行评估。此 无需训练 策略的累计成功率为 $35.1\%$,而每集查询一次的相同系统的成功率为 $3.5\%$。这个十倍的差距在每个场景族中都存在不重叠的置信区间。增益追踪到失败抓取时的 27.3\%$ 情节内恢复率:开环控制器将持续到情节结束的失误会被重新观察并在下一次重新计划时修复。而且环路仍然很便宜。平均 $84\%$ 的输入词元命中缓存,一个情节仅需要大约 $10$ 紧凑查询,并且在任何重新计划期间写入的控制块都会保留到在以后的提示中重用的跨情节技能库。