论文

CreatiParser:将光栅图形设计生成图像解析为可编辑图层

CreatiParser: Generative Image Parsing of Raster Graphic Designs into Editable Layers

应用与实践内容创作

摘要

图形设计图像由多个可编辑图层组成,例如文本、背景和装饰元素,而大多数生成模型生成没有明确图层结构的栅格化输出,从而限制了下游编辑。现有的图形设计解析方法通常依赖于布局预测、抠图和修复相结合的多级流程,存在误差累积和可控性有限的问题。我们提出了一种用于光栅到层图形设计解析的混合生成框架,该框架将设计图像分解为可编辑的文本、背景和贴纸层。使用视觉语言模型将文本区域解析为文本渲染协议,从而实现忠实的重建和灵活的重新编辑,而背景和贴纸层则使用支持 RGBA 的多分支扩散架构生成。我们进一步引入 ParserReward 并将其与组相关策略优化相集成,以使生成质量与人类设计偏好保持一致。对两个具有挑战性的数据集(即 Parser-40K 和 Crello 数据集)进行的广泛实验证明了其优于现有方法的性能,在所有指标上实现了 23.7% 的总体平均改进。