论文
BEE:利用视觉-语言-动作模型进行干预自适应现实世界强化学习
BEE: Intervention-Adaptive Real-World Reinforcement Learning with Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型可以处理长视野操作,但成功取决于几个精度关键的阶段,在这些阶段,毫米级的误差会毁掉所有先前的进展。在线强化学习(RL)可以准确地优化这些动作,但对于真实的机器人来说,自由探索的成本太高,这使得人工纠正变得不可或缺。然而,现有的 VLA 在线强化学习方法要么无法纳入此类修正,要么无法将其纳入无差别监督中。然而,人类的修正并非都是嘈杂的,但在某些行动维度上是可靠的,而在其他维度上则是可变的。在此基础上,我们引入了 BEE,这是一种基于冻结 VLA 的现实世界强化学习的干预自适应框架,使策略超越专家模仿。我们将人工修正制定为关于约束的证据,而不是重现的动作:修正模型预测人类将如何修正给定的 VLA 提案,以及修正在每个动作维度上的一致性。这种预测的一致性设置了策略优化约束的每个维度的紧密度。当修正一致时,政策就会保持接近人类,而当修正不同时,约束就会放松。我们在匹配的在线数据预算下,在三项真实操作任务和一项 LIBERO-Pro 模拟任务上评估 BEE。 BEE 在每项任务上都取得了最高的成功率,平均为 91.2%,而 RLT 为 57.5%,DSRL 为 42.1%,并且在所有现实世界任务中人工干预率最低。