论文
扩散对齐的缝合值模型
Stitched Value Model for Diffusion Alignment
摘要
为了实际使用,基于扩散或流的生成模型必须与特定任务的奖励保持一致,例如即时保真度或审美偏好。这种对齐具有挑战性,因为奖励是为干净的输出图像定义的,但对齐过程需要在嘈杂的中间潜伏处进行价值函数估计。现有方法采用 Tweedie 式或 Monte Carlo 近似,权衡估计器偏差与计算成本:Tweedie 估计有效但有偏差,而 Monte Carlo 估计更准确但需要昂贵的部署。一个自然的替代方案是学习价值函数,但如何有效地专门针对噪声潜伏训练强大且通用的价值模型仍然是一个悬而未决的问题。在这里,我们提出了 StitchVM,一种模型拼接框架,可以有效地将针对干净图像预训练的奖励模型转移到噪声潜在区域。 StitchVM 从现有的截断像素空间奖励模型开始,并附加一个冻结的扩散主干作为其头部。从像素空间模型来看,所得的混合体保留了经过精心预训练的强大奖励能力;从扩散主干中,它继承了处理噪声潜伏的固有能力。拼接过程非常轻量,例如,CLIP ViT-L 和 SD 3.5 Medium 的拼接和微调仅需要 10 个 GPU 小时。通过将强大的像素空间奖励模型提升到潜在空间,StitchVM 开辟了一种新的扩散对齐方式:不是对价值函数进行粗略但昂贵的每个样本近似,而是一次构建实际的、有噪声的潜在的正确函数,然后在许多样本和迭代中进行摊销。我们表明,这种方法在广泛的下游转向和 后训练 方法中产生了改进:DPS 速度提高了 3.2 倍,同时 GPU 内存峰值减半,而 DiffusionNFT 速度提高了 2.3 倍。