论文

Iris-3B:像素空间扩散模型的预训练、转换与适配

Iris-3B: Going Beyond the Latent with Pixel-Space Diffusion Training, Conversion and Fine-Tuning

模型训练模型评测应用与实践预训练模型行为与机制分析内容创作

摘要

像素空间扩散模型避免了潜空间模型的有损VAE,因而可能在需要精细细节的下游任务中更有优势。我们沿获得像素空间骨干的两条路线检验这一观点。先在256×256分辨率消融预测目标和表征对齐,确定扩展方案,再按256→512→1024的课程从零预训练Iris-3B,一个30亿参数的像素空间文生图Transformer。同时,我们把预训练潜空间模型FLUX.2 Klein base 4B转换到像素空间。我们对两类模型进行单目深度估计及图像修复、超分辨率微调,未发现像素空间生成先验带来显著改善。使用相同直接回归方案微调深度时,Iris-3B与潜空间FLUX.2 Klein持平,转换后的像素空间FLUX.2 Klein则落后;在4倍DIV2K图像修复中,两种像素模型都未超过经微调的潜空间FLUX.2 Klein,转换模型略落后。我们记录训练方案、失败模式及这一负结果尚存的混杂因素。尽管如此,Iris-3B仍说明,采用PixelDiT的像素Transformer(PiT)头可以将像素空间预训练扩展到30亿参数,并取得与潜空间模型有竞争力的文生图质量:在1024×1024分辨率和OneIG官方评测器下,它与Qwen-Image持平。我们开放权重和训练代码,支持像素空间生成的进一步研究。

Iris-3B:像素空间扩散模型的预训练、转换与适配:论文原图
图 5:FLUX.2 Klein 转换在 102421024^{2} 处仅 1K 步骤后进行探测,每个输入初始化和主干 LR 一列,步骤中的中值损失为 900-1000(PiT 头,全局批次 8;“增益脊”是增益匹配脊)。这些是用于比较初始化的早期诊断样本,而不是最终结果;转换后的模型见图6。