论文
iADD:提高扩散政策优化的一致性和多样性
iADD: Improving Alignment and Diversity in Diffusion Policy Optimization
摘要
基于强化学习的扩散模型后训练,例如去噪扩散策略优化(DDPO),可以在奖励函数下优化反向扩散过程。然而,当前的奖励优化方法是以牺牲多样性和质量为代价的。在本文中,我们通过仔细的理论考虑和方法设计提供了更好的权衡。我们分析了理论框架,并从数学上证明了扩散模型的 only-latter timestep 更新可能对多样性有害,这与之前工作中提出的结论相反。此外,我们提出基于强大理论基础的增量 Feynman-Kac 训练,以实现迄今为止最好的对齐与多样性权衡。我们进行了广泛的实验,并将我们的方法与三个不同任务中的相关扩散策略优化方法进行了比较,并且还为每个组件提供了强大的消融,从而验证了对齐和多样性方面的强大性能增益。