论文
从 RGB 生成到密集场读出:使用文本到图像模型的像素空间密集预测
From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models
摘要
大规模文本到图像模型对于密集预测来说是有吸引力的骨干,因为 RGB 生成预训练可以学习丰富的语义、结构和几何先验。现有的生成和编辑方法通过将密集预测作为目标生成来重用这些先验:深度、法线、alpha 遮罩、掩模和热图等注释被编码到 RGB 训练的 VAE 潜在空间中,并解码回类似图像的目标。我们认为,这继承了比密集预测所需的更多生成输出接口:与 RGB 合成不同,密集预测要求同一图像平面上的像素正确、任务本机字段,而不是渲染新的 RGB 内容。我们的主要观察结果是,预训练的 DiT 已经通过图像平面上的补丁到词元到补丁晶格来组织 RGB 输入,因此每个词元都索引一个固定的输出补丁,其通道可以携带任务本机量而不是 RGB 外观。我们将其实例化为 ReChannel:我们保留 DiT 输入分布的 VAE 编码器,但删除目标端解码器,使用任务 LoRA 调整冻结的 DiT,并通过共享词元局部线性头将每个词元映射到其 p x p x K_t 像素空间补丁 - 大约 33K 参数,无空间混合。使用 FLUX-Klein,我们评估了六个密集预测任务和十多个基准。这个最小的界面在无 trimap 抠图、KITTI 深度和参考分割方面设置了新的最先进技术,并在法线、显着性和姿势方面保持竞争力。在匹配的 4B 设置中,它比编辑加潜在解码的对应版本更准确,速度快 2.48 倍——密集感知可以从生成预训练中受益,而无需继承其输出接口。