论文

重新审视潜在扩散模型中的无分类器引导方法

Revisiting Classifier-Free Guidance Methods in Latent Diffusion Models

模型评测模型能力评测

摘要

推理时间质量增强方法是一种有效且广泛采用的改进扩散模型的方法,无需昂贵的再训练。我们研究了一系列 无需训练 技术,其概念上植根于无分类器指导 (CFG),其中大多数最初是在较旧的 U-Net 扩散模型上提出的,并使用独立评估图像质量的指标进行验证,而不考虑生成的图像与其相关文本提示之间的成分对齐或语义对应关系。我们在固定的每模型协议和三个组合对齐基准下,在两个开放权重整流流 Transformer 上重新评估了八种此类方法。没有一种方法能够在测量标准上持续改善 CFG。 APG 获得了几个名义上的最佳分数,但相应的收益往往仍处于估计的评估不确定性范围内。注意力扰动方法在 SD3.5 Medium 上提供了孤立的增益,在 FLUX.2 [klein] 4B Base 上提供了更频繁的降级,而 CFG 仍然是具有竞争力的低成本基准。