论文

基于分数的扩散采样的自适应重参数化时间

Adaptive Reparametrized Time for Score-Based Diffusion Sampling

模型推理解码与生成控制

摘要

我们研究基于分数的扩散采样的时间步分配,其中学习的逆时动态在有限网格上离散化。统一和手工制定的时间表是标准选择,但它们依赖于固定的处方,因此可能不是最佳的。为了解决这个限制,我们提出了自适应重新参数化时间(ART),这是一种连续时间控制公式,通过将采样时钟的速度作为控制来学习时间变化,以便学习时钟上的均匀网格在原始扩散时间中引入自适应时间步长。基于前导欧拉误差代理,ART 提供了沿着采样轨迹分配时间步长的原则性目标。为了解决这个确定性控制问题,我们引入了 ART-RL,这是一种具有高斯策略的辅助随机公式,可将调度学习转变为连续时间强化学习问题。我们证明,随机 ART-RL 公式在优化器级别相当于 ART,因为其最优高斯策略通过其均值恢复了最优 ART 时间扭曲率。我们进一步建立政策评估和政策改进特征,并得出基于轨迹的时刻身份,从而产生可实施的行动者—评价者更新以学习时间表。在从受控低维设置到图像生成的实验中,ART-RL 可以通过仅更改时间步网格来插入现有的扩散采样器,在匹配的预算下持续提高强基线计划的样本质量,同时保持采样管道的其余部分不变。学习到的时间表还表现出广泛的泛化性,无需重新训练即可跨采样预算、数据集、求解器、管道和表示空间进行迁移。