论文
并非所有词元对扩散学习的贡献均等
Not all tokens contribute equally to diffusion learning
摘要
随着条件扩散模型的快速发展,文本到视频的生成取得了重大进展。然而,我们观察到这些模型在推理过程中经常忽略语义上重要的标记,导致在无分类器指导下产生有偏差或不完整的生成。我们将此问题归因于两个关键因素:训练数据中的长尾标记频率引起的分布偏差,以及交叉注意力中的空间错位,其中语义上重要的标记被信息量较少的标记所掩盖。为了解决这些问题,我们提出了分布感知整流和空间集成(DARE),这是一个统一的框架,可以从分布去偏和空间一致性的角度改进扩散模型中的语义指导。首先,我们引入了分布校正无分类器指导(DR-CFG),它通过动态抑制低语义密度的主导标记来规范训练过程,鼓励模型更好地捕获代表性不足的语义线索并学习更平衡的条件分布。这种设计降低了模型分布过度拟合低语义密度标记的风险。其次,我们提出了空间表示对齐(SRA),它根据词元重要性自适应地重新加权交叉注意力图并强制表示一致性,使语义重要的词元在生成过程中发挥更强的空间指导。这种机制有效地防止了低语义密度标记主导注意力分配,从而避免了高语义密度标记提供的空间和分布指导的稀释。对多个基准数据集的大量实验表明,DARE 持续提高了生成保真度和语义对齐,比现有方法取得了显着的进步。