论文
VLA-Precision:用于视觉-语言-动作模型的高效现实世界在线强化学习的非对称协同引导
VLA-Precision: Asymmetric Co-Bootstrapping for Efficient Real-World Online RL of Vision-Language-Action Models
摘要
预训练的视觉-语言-动作 (VLA) 模型可实现广泛的操作,但在要求精度和可重复性的任务中仍然不可靠。将现实世界的在线强化学习(RL)应用于VLA 后训练可以实现超越演示的自主试错改进,但暴露出两个瓶颈:1)不可靠的价值信号可能导致政策漂移; 2) 大VLA开销限制了吞吐量和样本效率。为了应对这些挑战,我们提出了 VLA-Precision,这是一种高效的现实世界在线 RL 框架,采用非对称 Co-Bootstrapping (ACoB) 算法和 ACoB-Stream 架构。具体来说,ACoB 建立了跨时间尺度的非对称共同引导:早期干预引导的行为学习快速提高政策绩效,同时提高在线体验质量。随着自主经验的积累,全局回报传播和局部偏好排名逐渐校准价值估计,为参考正则化政策改进产生相对行动优势,同时抑制漂移。为了在大型 VLA 上启用 ACoB,我们开发了 ACoB-Stream,这是一种闭环体验策略架构,它将不变状态解耦和按需流作为设计原则,在吞吐量和计算效率方面提供高达 10.9 美元\倍的改进。对四个类别和四个机器人实施例的九个高精度化学任务的广泛评估表明,VLA-Precision 在 45.8 分钟/任务中实现了 98.3% 的平均成功率,其中 27.6 秒的运行时间是 VLA 和 RL 基线速度的 1.2$\times$ 和 1.8$\times$。资源可在 https://vla- precision.github.io 获取。