论文

扩散模型中的幻觉早期检测

Hallucination Early Detection in Diffusion Models

模型推理解码与生成控制

摘要

随着扩散模型的出现,文本到图像的生成在输出真实感方面取得了显着进步。然而,扩散模型在生成多个对象时会遇到困难,经常导致某些实体被省略的幻觉。虽然现有的解决方案通常侧重于优化扩散模型中的潜在表示,但初始生成种子的相关性通常被低估。虽然在多次迭代中使用不同的种子可以改善结果,但这种方法也显着增加了时间和能源成本。为了应对这一挑战,我们引入了 HEaD+(幻觉早期检测+),这是一种新颖的方法,旨在在扩散过程的早期识别不正确的世代。 HEaD+ 框架将交叉注意力图和文本信息与新颖的输入(预测最终图像)集成在一起。目标是评估是否继续当前一代或使用不同的种子重新启动它,从而在节省时间的同时探索多代种子。 HEaD+ 在新创建的 InsideGen 数据集上进行了训练,该数据集包含 45,000 个生成的图像,每个图像包含最多七个对象的提示。我们的研究结果表明,当将 HEaD+ 与现有模型一起应用时,用四个对象实现完整生成(即准确代表所有指定主题的图像)的可能性增加了 6-8%。此外,当以完整图像为目标时,HEaD+ 可将生成时间缩短高达 32%,从而相对于领先模型提高生成完整且准确的对象表示的效率。此外,我们提出了一个集成的定位模块,可以预测对象质心位置并在中间时间步验证成对空间关系(如果用户请求),将生成与对象存在一起进行门控,以进一步改善关系一致的结果。