论文
BORA:桥接离线强化学习和在线残差适应,实现现实世界灵巧的 VLA 模型
BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models
摘要
视觉-语言-动作(VLA)策略为灵巧的操作提供了强大的行为先验,但将它们应用到真实的机器人上仍然具有挑战性,因为高自由度的接触故障对于人类来说很难纠正,而且在线交互的成本很高。我们提出了 BORA,一个离线到在线的强化学习系统,它将动作条件批评家集成到一致性策略 VLA 中,并重用学习的批评家进行冻结基残差适应。为了获得可执行的校正数据,BORA 将可穿戴式手臂远程操作与示范引导的本地策略相结合,将粗略的人类意图转化为协调的、特定于具体实施例的手指动作,以实现接触丰富的技能。在线机器人部署和人工修正与离线数据混合,仅更新轻量级残差参与者,避免全模型 微调。我们使用配备两个灵巧手模型的单臂和双手平台在六项实际任务中评估 BORA。每个任务只需 20 个在线轨迹,BORA 将标准物体的平均成功率从 60.8% 提高到 82.5%,将保留物体的平均成功率从 52% 提高到 70%,而政策援助则大大提高了双手扭转干预的可靠性。这些结果展示了从可执行的人工校正到高效的真实机器人 VLA 适应的实用途径。