论文

PixelART:无需潜在或文本到图像预训练的图像到层分解

PixelART: Image-to-Layer Decomposition without Latents or Text-to-Image Pretraining

应用与实践内容创作

摘要

图像到图层分解将扁平图像转换为可编辑的 RGBA 图层,从而在设计工作流程中实现元素级编辑。现有的基于扩散的系统通常采用大型预训练文本到图像 (T2I) 模型,并引入 RGBA 自动编码器或可变层架构模块。我们重新审视这个设计选择,并询问层分解是否真的需要这些重量级组件。我们介绍 PixelART,这是一种从头开始训练的像素空间整流流 Transformer,用于图像到层 (I2L) 分解。 PixelART 使用单流多模态扩散 Transformer 直接对区域 RGBA 像素块进行去噪,避免使用 RGBA-VAE、预训练的 T2I 主干和特定于层的解码器。我们确定了该任务的一个关键属性:高噪声时间步长决定层分配和粗略层组织,而低噪声时间步长主要细化颜色、alpha、纹理和边界。基于这一观察,我们提出了一种终端增强的时间步采样策略,以增加高噪声层分配机制中的训练覆盖率。 PixelART 在 4M 多层设计模板上进行训练,在 Design-Multi-Layer-Bench 和 LICA 上实现了最先进的层分解和复合重建,与最新的 Qwen-Image-Layered 模型相比,参数减少了 80% 以上,延迟降低了 98%,内存减少了 85%。消融实验表明,像素空间 $\mathbf{x}$ 预测、终端增强时间步采样和数据/模型缩放至关重要,而 T2I 预训练为 I2L 任务带来边际效益。