论文
RepFusion:利用多模态先验在表示空间中进行去噪
RepFusion: Leveraging Multimodal Priors for Denoising in Representation Space
摘要
大语言模型 (LLM) 广泛用于文本到图像 (T2I) 系统,但它们通常仅限于文本编码,而去噪则由新训练的生成主干处理。表示自动编码器 (RAE) 的出现将生成目标转向语义结构化的视觉表示,从而创建与预训练的 LLM 先验更兼容的潜在空间。受多模态 LLM (MLLM) 的启发,MLP 投影仪足以将干净的视觉表示与预训练的 LLM 对齐,我们将 MLLM 本身重新用作噪声表示编码器,将此机制从干净输入扩展到噪声输入。我们提出了 RepFusion,它使用所得的 MLLM 输出作为扩散 Transformer 的调节信号。在类似推理预算的受控比较中,RepFusion 的性能优于将同等容量用于新初始化的降噪器的基线。这些结果表明,MLLM 为去噪视觉表示提供了强大的先验,并且通过对不断演变的噪声表示进行调节,测试时计算可以高效地用于现代 T2I 系统中的重复 MLLM 调节。