论文

UniSteer:统一噪声转向,实现高效的人工引导 VLA 适应

UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation

模型训练强化学习

摘要

基于扩散的视觉语言动作(VLA)模型已成为机器人操作的重要先验模型,但使其适应现实世界的分布仍然具有挑战性。特别是,机器人强化学习(RL)既昂贵又耗时,因此有效的适应取决于现实世界交互的有限预算内的有效政策改进。噪声空间 RL 通过将预训练的 VLA 固定为去噪生成器,同时仅更新预测噪声的轻量级 actor,从而降低了成本。然而,由于自主探索效率低下,其性能仍然受到限制。人类纠正干预可以减轻这种探索负担,但它们自然是在动作空间中提供的,而噪声空间微调需要对噪声变量进行监督。为了应对这些挑战,我们提出了 UniSteer,这是一种统一噪声引导框架,通过近似动作噪声反演将人类纠正指导与噪声空间 RL 结合起来。给定人类纠正动作,UniSteer 反转冻结的流匹配解码器以恢复噪声目标,这为通过强化学习同时优化的同一噪声参与者提供监督指导。针对各种操纵任务的现实世界实验表明,UniSteer 比强噪声空间 RL 和动作空间人机循环基线更有效地适应,在 66 分钟内将四项现实世界适应任务的成功率从 20% 提高到 90%。