论文

EXPO-FT:视觉-语言-动作模型的样本高效强化学习微调

EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models

模型训练强化学习

摘要

高效、可靠地学习新任务的能力一直是机器人技术的基本挑战。视觉-语言-动作(VLA)模型在不同的操作任务中表现出了很强的泛化性,但预训练的策略始终达不到现实世界部署所需的可靠性。强化学习 (RL) 微调 提供了一条有希望的途径来弥补这一差距,但现有方法要么从头开始训练,而没有充分利用预训练的先验知识,要么微调 VLA,而没有达到实际部署所需的样本效率和成功率。我们推出了 EXPO-FT,这是一个稳定、样本高效的 RL 微调系统,可以对预训练的 VLA 策略进行微调,从而弥补这一差距。我们的系统解决了一系列具有挑战性的操作任务,包括布置灯串并插入插头将其点亮,将台球击入口袋中,以及将花朵插入酒瓶中,每项任务都需要高精度、动态动作和对不同初始状态的鲁棒性的组合。我们的系统在平均 19.1 分钟的在线机器人数据内,在所有评估的任务中实现了完美的任务性能(30/30 成功),优于之前的 RL 从头开始​​和 VLA 微调方法。我们发布了一个开源代码库,旨在促进机器人领域更广泛地采用 VLA 模型的 RL 微调。