论文
用于流量策略引导和加速的最佳传输 Q-Learning
Optimal Transport Q-Learning for Flow Policy Steering and Acceleration
摘要
扩散和流动策略最近通过准确捕获多模态机器人轨迹分布,特别是在视觉语言动作(VLA)模型的背景下,在机器人应用中表现出了卓越的性能。然而,高质量的政策绩效还需要快速的推理和高质量的演示,而这往往很难获得。缺乏这些会导致政策行为不佳以及分配转移下的失败。在这项工作中,我们通过 RL 后训练 解决了 微调 的问题,并利用机器人的经验加速基于次优流的策略。我们引入了最优传输 Q-学习 (OTQL),这是一种使用优势加权条件最优传输流匹配来微调流策略的新方法。 OTQL 可以通过 50-60 集的交互预算来微调和加速流程,同时避免模拟和现实世界机器人任务中计算成本高昂的 蒸馏。我们的结果表明,OTQL 使用机器人自身的经验来训练流程策略,将单任务策略的平均成功率从 36% 提高到 86%,将预训练的 VLA 从 38% 提高到 76%,同时将每个动作生成的推理步骤数减少 70%。