论文
VLA-OPD:通过 同策略 蒸馏 连接视觉-语言-动作模型的离线 SFT 和在线 RL
VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation
摘要
尽管预训练的视觉-语言-动作 (VLA) 模型在机器人操作方面表现出令人印象深刻的泛化能力,但 后训练 对于确保部署期间的可靠性能仍然至关重要。然而,标准离线监督 微调 (SFT) 面临着分布变化和预训练能力灾难性遗忘的问题,而在线强化学习 (RL) 则面临着奖励稀少和样本效率低下的问题。在本文中,我们提出了 同策略 VLA 蒸馏 (VLA-OPD),这是一个将 SFT 的效率与 RL 的鲁棒性结合起来的框架。 VLA-OPD 不依赖稀疏的环境奖励,而是利用专家教师对学生的自我生成轨迹进行密集的 词元级 监督。这使得能够主动纠错 同策略 引起的状态,同时通过温和的对齐保留预先训练的一般功能。至关重要的是,我们通过 Reverse-KL 目标制定了 VLA-OPD。与引起模式覆盖熵爆炸的标准 Forward-KL 或导致过早熵崩溃的 Hard-CE 不同,我们的有界模式寻求目标通过过滤掉教师的认知不确定性同时保持行动多样性来确保稳定的政策学习。 LIBERO 和 RoboTwin2.0 基准测试表明,VLA-OPD 显着提高了 RL 的样本效率和 SFT 的鲁棒性,同时有效减轻了 后训练 期间的灾难性遗忘。