论文

FORCE:通过价值校准热身和自我 蒸馏 进行高效 VLA 强化 微调

FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation

模型训练强化学习

摘要

视觉-语言-动作 (VLA) 模型通常受到次优数据所施加的模仿上限的限制。虽然强化学习 (RL) 微调 可以超越此限制,但众所周知,它的样本效率很低。这一挑战源于两个核心问题:(1) 由于 Q 函数不稳定而导致灾难性的初始遗忘;(2) 低质量的勘探数据导致政策更新效率低下,通常迫使人们依赖昂贵的人工干预。我们引入了 FORCE,这是一个三阶段框架,可以通过解决这两个问题来稳定 微调。 FORCE 首先纳入了价值校准预热阶段,利用 同策略 采样轨迹来减轻 Q 函数的分布变化。随后,在在线阶段,这个校准的 Q 函数充当策略自身的行动建议和专家数据的过滤器,确保仅高价值的行动用于策略更新。我们在各种模拟和现实任务上评估 FORCE,结果表明 FORCE 的成功率绝对提高了 79%,比之前的 RL 方法提高了 10%,同时将训练速度加快了 32.5%。至关重要的是,它缓解了常见的成功率下降,并在无需人工干预的情况下实现了这种强大的性能,标志着朝着部署有能力的自主机器人代理迈出了重要一步。