论文
漂移场策略:通过 Wasserstein 梯度流的一步生成策略
Drifting Field Policy: A One-Step Generative Policy via Wasserstein Gradient Flow
摘要
我们提出了漂移场策略(DFP),这是一种基于漂移模型范式的非 ODE 一步生成策略。我们将策略更新构建为朝向软目标策略的反向 KL Wasserstein-2 梯度流,以便每个 DFP 更新对应于概率空间中的一个梯度步骤。通过构造,该梯度被分解为向更高动作值区域的上升和与作为信任区域的锚定策略匹配的分数。我们进一步推导了一个简单、易于处理的替代品,该替代品原本是棘手的更新损失,类似于对前 K 个评论家选择的动作进行行为克隆。我们凭经验发现,这种机制由于其非 ODE 参数化而独特地有利于漂移主干。通过一步推理,DFP 在 Robomimic 和 OGBench 的多项操作任务上实现了最先进的性能,优于基于 ODE 的策略。