论文

ReaDiT 指南:使用扩散控制图像和视频生成 Transformer 功能

ReaDiT Guidance: Control for Image and Video Generation using Diffusion Transformer Features

模型推理解码与生成控制

摘要

我们提出了 DiT Readout (ReaDiT) Guidance,这是一个轻量级框架,用于通过 Diffusion Transformer (DiT) 模型通过其内部特征表示来控制生成。 ReaDiT Guidance 使用单个 DiT 块的特征来根据测试时提​​供的空间目标(例如深度、姿态或边缘图)来引导生成过程。此外,由于现代文本到视频模型主要建立在 DiT 主干之上,因此 ReaDiT Guidance 自然会扩展到视频生成,从而实现相机和运动控制。实验结果表明,与现有的基于特征和现成的基于适配器的方法相比,我们的方法实现了有竞争力或改进的结果,同时需要更少的参数。