论文

EXIMO:VLM引导的VLA策略探索

EXIMO: VLM Guided Exploration of VLA Policies

摘要

如何高效微调机器人策略以快速学习新任务?最先进的机器人操作策略基于在大型遥操作数据集上对数十亿参数的视觉-语言-动作(VLA)模型进行行为克隆。虽然这一简单方法已推动机器人操作取得重大进展,但微调 VLA 策略以学习新任务仍是一个开放问题。特别是,收集遥操作数据集需要数百小时昂贵的人力劳动,而替代方案强化学习(RL)的样本效率却出了名地低,对长时程任务尤其如此。此外,由于模型的规模和架构设计,用 VLA 做 RL 还带来若干挑战。在这项工作中,我们提出 EXIMO,一种高效的 VLA 策略微调算法。EXIMO 分三个阶段运行:探索、模仿和优化。在探索阶段,EXIMO 为 VLA 配备一个充当规划器的视觉语言模型(VLM)。VLM 进行思考,把具有挑战性的长时程问题分解为较短的问题交给 VLA。VLM 与 VLA 一起用于在新任务上收集经过编排的数据集。在模仿阶段,VLA 用这些编排数据进行微调。最后,在优化阶段,我们使用残差离策略 RL 进一步微调策略。在实验中,我们对 EXIMO 的三个阶段进行了消融,并表明它在样本效率和最终性能方面显著优于现有方法。

EXIMO:VLM引导的VLA策略探索:论文配图
图1:VLM在Eximo探索阶段的交互示例。VLM在提示词中被给定来自环境的一系列图像以及任务描述。VLM在<think> </think>块内分析所提供的信息,并在<answer></answer>块中给出供VLA执行的指令。