论文
FlowPRO:通过近似偏好优化的流量匹配 VLA 的无奖励强化 微调
FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization
摘要
后训练 将视觉-语言-动作(VLA)模型转化为可以可靠地部署在真实机器人上的策略仍然是一个主要瓶颈。 SFT 和 DAgger 仅间接利用失败信号,而基于奖励的 RL 因现实世界的奖励设计和训练可靠批评者的困难而受到瓶颈。我们推出 FlowPRO,一个用于流量匹配 VLA 的无奖励离线强化 微调 框架。在算法上,我们提出了 RPRO(机器人流程匹配近似偏好优化),这是一种针对 VLA 模型的流程匹配动作头量身定制的偏好优化目标。 RPRO 将对比优化器与显式近端正则器配对,该正则器锚定隐式奖励的绝对大小,从而消除普通 Flow-DPO 的 奖励作弊 故障模式。在数据方面,远程操作的干预和回滚范式通过单个操作员动作在真实机器人上产生自然配对的正负轨迹 $(τ^w, τ^l)$;然后,平滑插值过程与批量混合相结合,将这些稀疏校正转换为密集的每状态监督,同时保留基本策略的功能。在四项长视野双手任务中,FlowPRO 获得了最高的成功率,优于四个代表性基线,并且消融证实了每个损失分量的贡献。