论文
MRT:用于大规模分层图像生成和编辑的遮罩区域 Transformer
MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale
摘要
分层图像生成和编辑是一项基本功能,可以对生成的视觉内容进行分层重用、编辑和组合,类似于自然语言中的字级编辑。尽管它很重要,但它仍然是一个尚未得到充分探索的领域。为了解决这一差距,我们提出了 MRT,这是一种专为多层透明图像生成和编辑而定制的 20B 参数掩模区域扩散模型,经过超过 1000 万个跨越不同长宽比和文本提示的多语言设计样本的训练。为了充分利用这一规模,我们做出了两项关键的技术贡献。首先,我们在共享蒙版区域扩散框架内统一了三个互补任务,包括文本到图层、图像到图层和图层到图层,其中选择性标记蒙版可以实现灵活的分层生成和编辑。其次,为了启用溢出层生成,我们引入了一个溢出感知画布层,该层可以处理边界不一致并支持半透明背景合成,从而使完整的可编辑层扩展到可见画布边界之外。此外,我们应用扩散 蒸馏 来实现 8 步实时多层生成,同时将质量下降降至最低。大量的实验表明,我们的框架在所有三项任务中都远远优于先前最先进的方法,包括各种商业系统,为多层透明图像生成建立了新的基准。值得注意的是,根据用户研究结果,我们的模型在图像到层质量方面显着优于并发 Qwen-Image-Layered 模型,同时推理速度提高了 10-100 倍,并且在图像到层推理期间将激活 GPU 内存消耗减少了 50-90%。