PixelDense:密集预测作为像素扩散的表示对齐
PixelDense: Dense Prediction as Representation Alignment for Pixel Diffusion
摘要
表示对齐(REPA)加速了扩散Transformer的训练,但其对齐目标几乎都是语义编码器,例如 DINOv2 和 CLIP。最近的分析指出,空间结构(而不是全局语义)是对齐效应的载体,但经过训练来预测该结构的密集预测基础模型仍然被忽视为 REPA 目标。在像素空间扩散方面,SAM2、Depth Anything v2 和 Metric3D v2 均优于仅 DINOv2 GenEval 基线,其中两位几何教师领先于分割教师。然而,由于语义和几何梯度争夺一个降噪器投影,所有四位教师的总和低于最佳的单一几何教师。我们引入了 PixelDense,它通过语义投影流路由 DINOv2 和 SAM2,通过几何投影流路由 Depth Anything v2 和 Metric3D v2,并添加权重空间正交性惩罚,使两个流保持在不相交的子空间中。所有四位老师在训练期间都被冻结并在推理时掉落。 PixelDense 通过单一配方应用于 PixelGen 和 DeCo,改进了 GenEval、DPG-Bench 和 HPS v2.1,将 PixelGen-XXL 的 GenEval 总体从 0.7927 提高到 0.8093,并击败了所有单教师和未分解的多教师变体。在部分噪声重建中,独立的全景、深度和表面法线探头在 $τ=0.5$ 上在 COCO 和 Flickr30K 上显示出高达 53.1% 的 PQ 增益和 36.0% 的深度 AbsRel 降低。从随机初始化开始,PixelDense 达到基线 GenEval 峰值的速度也快了 1.23 倍。在 PIE-Bench 上的 SDEdit 编辑中,PixelDense 在每个编辑强度下保留更多的源背景和布局,将背景 PSNR 提高高达 2.2 dB。