论文
扩散心理平均值
Diffusion Mental Averages
摘要
扩散模型能否产生自己的概念“心理平均值”——与典型样本一样清晰和现实?我们引入扩散心理平均值(DMA),这是对这个问题的以模型为中心的答案。虽然先前的方法旨在平均图像集合,但当应用于同一提示的扩散样本时,它们会产生模糊的结果。这些以数据为中心的技术在模型之外运行,忽略了生成过程。相比之下,正如最近的研究发现的那样,DMA 在扩散模型的语义空间内进行平均。由于这个空间跨时间步长演变并且缺乏直接解码器,因此我们将平均视为轨迹对齐:优化多个潜在噪声,使它们的去噪轨迹逐渐收敛到共享的从粗到细的语义,从而产生一个清晰的原型。我们通过在语义丰富的空间(例如 CLIP)中对样本进行聚类,并应用文本反转或 LoRA 将 CLIP 集群桥接到扩散空间中,将我们的方法扩展到多模态概念(例如,具有多种品种的狗)。据我们所知,这是第一种即使对于抽象概念也能提供一致、现实的平均值的方法,作为具体的视觉摘要以及模型偏差和概念表示的镜头。