论文
用于扩散的质量感知调制 Transformer
Quality-Aware Modulation for Diffusion Transformers
摘要
现代文本到图像的扩散模型,例如扩散 Transformer (DiT),依靠时间步长或提示嵌入来调节每个时间步长中去噪过程的强度。虽然这种调制传达了当前的噪声水平,但它不提供任何质量感知信息,这可能导致生成的图像未对齐、视觉不一致且缺乏保真度。在本文中,我们提出了质量表示模块(QRM),这是一个轻量级的 Transformer 模块,它根据现有模型输入学习质量感知表示,并生成一组向量 $M_{qrm}$。这些向量调整 DiT Transformer 块内的自适应 LayerNorm 调制,从而将质量敏感信号注入降噪参数。 QRM 对采样计划或扩散主干没有引入重大变化。实验包括对 QRM 训练损失和架构的消融,以及证明图像质量相对于基于 DiT 的基线模型的一致改进的实证结果。