论文

打破锁定:通过表示调制实现文本到图像生成的多样化

Breaking the Lock-in: Diversifying Text-to-Image Generation via Representation Modulation

模型推理解码与生成控制

摘要

最近基于大规模 Transformer 主干和基于流的目标构建的文本到图像模型提供了强大的文本图像对齐和高视觉质量,但通常在固定提示下生成过于相似的样本。现有的多样性增强方法可以缓解这个问题,但通常需要昂贵的采样或辅助优化,从而产生不小的开销。为了调查这种同质性的根本原因,我们检查了中间 Transformer 特征,并观察到零频率空间平均(DC)分量在生成早期在种子之间快速收敛,导致早期轨迹锁定,从而限制了下游变化。基于这一观察,我们提出了 DC 多样性增强衰减 (DAVE),这是一种 无需训练 代表性级别的干预措施,可选择性地削弱早期制度中的这一组成部分。 DAVE 以可忽略不计的开销保留了采样管道,提高了即时一致性的多样性,同时保持了有竞争力的图像质量。