论文

奖励引导扩散的分层变分策略

Hierarchical Variational Policies for Reward-Guided Diffusion

模型推理推理加速

摘要

将预训练的扩散模型适应下游目标(例如逆问题)通常需要昂贵的测试时间指导或优化。我们提出了一个原则框架,以大幅降低推理成本来生成高质量的奖励一致样本。我们的方法将测试时间适应制定为分层变分模型,其中控制被分摊为轻量级但富有表现力的随机策略。这种公式自然支持少步扩散采样:大步长可以实现快速推理,而学习策略通过提供结构化的每步控制来保持样本质量。由此产生的完全摊销采样器实现了强大的质量 - 速度权衡,匹配或超过最近的测试时间缩放基线,同时需要显着减少的计算。例如,在 4 倍超分辨率下,与性能最佳的基线相比,我们的方法实现了更好的感知质量,推理速度快了 5 倍以上。我们进一步将我们的方法扩展到半摊销机制,将廉价的摊销提案与有限的测试时间优化相结合,在几个具有挑战性的逆问题上实现最先进的感知质量。