论文

我们真的倾斜了吗?流动和扩散模型中的奖励引导机制

Are we really tilting? The mechanics of reward guidance in flow and diffusion models

模型推理解码与生成控制

摘要

奖励引导算法在推理时将学习的生成过程引导向奖励倾斜的度量。虽然经验上很有效,但这些方法很容易出现 奖励作弊:引导模型以牺牲学习分布的保真度为代价过度优化奖励。先前的研究将其归因于神经奖励函数的复杂性或扩散训练中的隐性偏差,但其基本起源仍然知之甚少。我们证明,奖励作弊 源于奖励引导扩散的大多数实际实现中的近似(Doob h 函数的有限粒子插件估计),即使是在具有二次奖励的高斯和高斯混合目标的最简单的非平凡设置中。在封闭形式中,我们隔离了插件估算器的两种不同的故障模式:它会导致每种模式内的 奖励作弊 并且无法选择高奖励模式。我们提出了一种封闭形式的奖励阻尼计划,无需额外的计算即可纠正模式内偏差,并阐明最佳 n 采样在补偿模式选择失败中的作用。高斯混合目标、2D 棋盘和 FLUX.1 文本到图像生成的实验证实了我们的理论见解可以应用于实际设置。