论文
QF3:通过过滤 Q 梯度加速流策略强化学习与生成模型微调
QF3: Fast Flow RL with Filtered Q-Gradients
摘要
流策略已成为从示范学习机器人行为的常见策略,但仍需强化学习改进预训练流策略,或通过交互从零学习。QF3是在线异策略强化学习算法,以流匹配和价值评论器的动作梯度训练流策略,梯度通过流输出的一步预测反向传播。为在评论器和预测可靠处更新,仅对接近经验回放动作的动作维应用评论器梯度。据作者所知,这是首个从零训练人形运动策略并零样本迁移到硬件的异策略流强化学习方法。结合高吞吐异策略训练,相对同策略方法FPO++,人形运动及动作跟踪训练实际耗时加速10倍。进一步用于ABC-Sim及Robomimic上预训练流式操作策略微调。结果表明既能从零学机器人策略,也能改进示范习得策略。网站:https://qf3-rl.github.io/。