论文
扩散模型中减少幻觉的评分控制
Score-Control for Hallucination Reduction in Diffusion Models
摘要
扩散模型已成为现代生成人工智能的支柱,推动视觉、语言、音频和其他模式的进步。尽管取得了成功,但他们却遭受了幻觉、难以置信的样本的困扰,这些样本不受真实数据分布的支持,从而降低了可靠性和信任度。在这项工作中,我们首先凭经验证实了先前提出的假设,即评分平滑度会导致图像生成扩散模型中的幻觉,并提供基于密度的视角。我们通过将幻觉概率质量与学习得分函数的 Lipschitz 常数联系起来,进一步形式化了这个概念。受此启发,我们引入了方差引导分数调制(VSM)策略来控制分数雅可比行列式,从而降低分数平滑度并更好地逼近 真值 分数,从而减少幻觉。合成数据集和真实世界数据集的实证结果表明,我们的方法在保持高保真度和多样性的同时减少了幻觉(高达约 25%),为更可靠的基于扩散的图像生成迈出了原则性的一步。我们还提出了两个具有极端语义变化的基准数据集,用于系统幻觉评估。代码和数据集可在 https://github.com/bhosalems/VSM 上公开获取。