RiT:普通扩散 Transformer 足以满足表示空间的要求
RiT: Vanilla Diffusion Transformers Suffice in Representation Space
摘要
与 $x$ 预测的流匹配——回归干净的数据点而不是环境速度——已知可以在像素空间中有效地利用低维流形结构\cite{li2025back}。我们询问预训练的表示空间在包含具有可比内在维度的低维数据流形的同时,是否提供了更有利于流匹配学习的分布。沿四个几何轴比较像素、SD-VAE 和 DINOv2 特征,我们发现像素和 DINOv2 具有几乎相同的内在维度(均为 $\hat{d}\!\approx\!33$),但 DINOv2 表现出 $7.3\times$ 更高的有效秩、$35\times$ 更好的协方差条件、$11.5\times$ 较低的超峰度,以及歧管插值误差降低 $1.7\times$; SD-VAE 潜伏始终处于中等水平,表明其优势源于表示学习目标而不仅仅是压缩。这些统计特性使得流匹配回归条件良好,并且消除了对先前 DINOv2 扩散方法所使用的专门预测头或黎曼传输的需要。我们提出了 \emph{Representation Image Transformer} (RiT):一种普通的扩散 Transformer,通过对冻结 DINOv2 特征的 $x$ 预测进行训练,仅通过维度感知噪声计划和联合 \texttt{[CLS]}-patch 建模进行增强。在 ImageNet $256{\times}256$ 上,RiT 在没有指导的情况下达到了 FID 1.45,在无分类器指导的情况下达到了 1.14,优于 DiT$^\text{DH}$-XL,参数少了 $19\%$(676M vs.\ 839M)。生成的 ODE 在粗离散化时可有效求解:在无分类器指导下,$5$ Heun 步骤已经达到 FID 2.0,$10$ 步骤达到 1.25,无需 蒸馏 或一致性训练。代码位于 https://github.com/lezhang7/RiT。