论文
Iris-3B:像素空间扩散模型的预训练、转换与适配
Iris-3B: Going Beyond the Latent with Pixel-Space Diffusion Training, Conversion and Fine-Tuning
摘要
像素空间扩散模型避免了潜空间模型的有损VAE,因而可能在需要精细细节的下游任务中更有优势。我们沿获得像素空间骨干的两条路线检验这一观点。先在256×256分辨率消融预测目标和表征对齐,确定扩展方案,再按256→512→1024的课程从零预训练Iris-3B,一个30亿参数的像素空间文生图Transformer。同时,我们把预训练潜空间模型FLUX.2 Klein base 4B转换到像素空间。我们对两类模型进行单目深度估计及图像修复、超分辨率微调,未发现像素空间生成先验带来显著改善。使用相同直接回归方案微调深度时,Iris-3B与潜空间FLUX.2 Klein持平,转换后的像素空间FLUX.2 Klein则落后;在4倍DIV2K图像修复中,两种像素模型都未超过经微调的潜空间FLUX.2 Klein,转换模型略落后。我们记录训练方案、失败模式及这一负结果尚存的混杂因素。尽管如此,Iris-3B仍说明,采用PixelDiT的像素Transformer(PiT)头可以将像素空间预训练扩展到30亿参数,并取得与潜空间模型有竞争力的文生图质量:在1024×1024分辨率和OneIG官方评测器下,它与Qwen-Image持平。我们开放权重和训练代码,支持像素空间生成的进一步研究。
