论文
SwiftExplorer:无需训练 扩散模型与 Swift 多样性探索的对齐
SwiftExplorer: Training-free Diffusion Model Alignment with Swift Diversity Exploration
摘要
扩散模型具有一般生成能力,但很难与特定目标保持一致。 微调 可以改善对齐,但其训练成本往往令人望而却步。这导致了 无需训练 方法,该方法在抽样中应用客观引导术语,使生成分布偏向指定区域,例如高回报区域。然而,这些方法面临两个问题:(1)强方向偏差缩小了预训练分布和生成多样性,(2)不加区别的恒定指导无法修剪冗余信号,损害了质量和效率。为了解决上述挑战,我们提出了 SwiftExplorer,这是一个插件,可以减轻过度多样性损失导致的分布崩溃并降低计算成本。首先,我们采用继承-重启探索机制来避免过早收敛,同时探索也增加了高回报轨迹的可能性。此外,它还平衡了多样性和保真度,增加了多样性而不会导致分布过度偏移。其次,我们的质量效率仲裁机制通过消除不正确的信号来改进指导,并通过在完整性和边际奖励增益最佳时动态停止生成来减少计算。在大量的实验和不同类型的评估指标中,所提出的 SwiftExplorer 在所有指标上都取得了优异的性能,包括偏好、保真度、多样性和丰富性。