论文
DiPOD:扩散策略优化而不偏离
DiPOD: Diffusion Policy Optimization without Drifting Apart
摘要
RL 后训练 对于改进扩散政策变得越来越关键,但现有的扩散政策梯度方法往往不稳定,无法实现可靠的政策改进。我们将原因确定为双漂移现象:优化变分代理可以让 ELBO 与真实的对数似然分离,从而使生成的代理策略梯度与预期回报的真实策略梯度不一致。我们提出了 \textbf{DiPOD},一种扩散策略优化框架,通过将 self-蒸馏 与策略改进梯度更新交织在一起,在整个训练过程中保持紧束缚行为。这导致了一种简单实用的算法:使用 同策略 ELBO 正则化器增强每个扩散策略梯度更新。在扩散语言模型 后训练 和连续控制扩散策略中,DiPOD 大大稳定了训练,并比以前的方法获得了更高的奖励。