论文
LISA:视觉条件可控生成的似然得分对齐
LISA: Likelihood Score Alignment for Visual-condition Controllable Generation
摘要
流行的双分支范式,即训练侧网络来编码视觉条件并将其中间层特征融合到冻结的预训练主网络中,在视觉条件可控生成方面取得了显着的成功。尽管它被广泛采用,但侧分支的作用及其训练效率仍未得到充分探索。在本文中,我们首先通过基于分数的生成模型重新审视这一主流范式:1)主网络通过提供先验无条件分数来保持视觉感知质量。 2)侧网络通过隐式贡献似然分数来引导条件控制。在这个观点的指导下,我们提出了似然得分对齐(LISA),这是一种有效的正则化方法,可以将侧网络的中间特征与近似似然得分明确对齐。具体来说,我们首先从侧网络的指定层挂钩特征,并通过轻量级解码器将它们投影到分数潜在空间中。然后,我们构建一个近似似然得分目标,并计算解码器输出与该目标之间的距离作为附加正则化损失。最后,我们使用标准扩散损失和正则化损失联合优化侧网络和解码器。跨各种图像/视频任务、架构和扩散/流模型的实验表明,LISA 不仅可以持续加速训练收敛并改善最终的合成结果,而且还可以鼓励侧网络的特征更加分离以进行条件建模,而额外的训练成本可以忽略不计,额外的推理成本为零。