论文
QPILOTS:针对流量策略的高效测试时 Q 转向
QPILOTS: Efficient Test-Time Q-Steering for Flow Policies
摘要
流匹配和扩散策略是富有表现力的动作生成器,但使用时差强化学习(RL)对其进行优化仍然很困难。有效的策略提取需要利用批评者的动作梯度,但通过多步去噪过程直接反向传播该信号可能在数值上不稳定。现有方法通过丢弃梯度信息、将策略提炼为更简单的单步参与者或随着批评者的改进而重复 微调 去噪策略来解决此问题。我们提出了 QPILOTS,一种不修改原始策略并在推理时引导去噪过程的方法。在每个去噪步骤中,我们不是在批评者预测不可靠的嘈杂的中间动作上评估批评者,而是首先将该中间状态投影为最终干净动作的估计,并在那里计算批评者梯度。我们引入两种变体:QPILOTS-U 使用快速单点近似,而 QPILOTS-M 通过学习的辅助网络绘制可微的后验样本。在标准的离线到在线 RL 基准上,QPILOTS 实现了最佳综合性能,在 50 个任务中达到了 90% 的平均成功率。我们还应用 QPILOTS 来引导大型、冻结、预训练的视觉语言动作 (VLA) 基础模型,在模拟中的六个操作任务中超越或匹配先前的推理时间方法。