论文
SEAL:具有大规模贴纸标签数据集的语义感知单图像贴纸个性化
SEAL: Semantic-aware Single-image Sticker Personalization with a Large-scale Sticker-tag Dataset
摘要
在基于扩散的个性化文本到图像生成中,从单个参考图像合成目标概念具有挑战性,特别是对于提示通常需要显式属性编辑的贴纸个性化。仅使用一个参考,测试时 微调 (TTF) 方法往往会过度拟合,产生 \textit{视觉纠缠},其中背景伪影被吸收到学习的概念中,以及 \textit{结构刚性},其中模型记住参考特定的空间配置并失去上下文可控性。为了解决这些问题,我们引入了 \textbf{SE}mantic-aware 单图像贴纸 person\textbf{AL}ization (\textbf{SEAL}),这是一个即插即用、与架构无关的适应模块,可以集成到现有的个性化管道中,而无需修改其基于 U-Net 的扩散主干。 SEAL 在嵌入适应过程中应用三个组件:(1) 语义引导的空间注意力损失,(2) 拆分合并词元策略,以及 (3) 结构感知层限制。为了通过属性级控制支持贴纸域个性化,我们提出了 StickerBench,这是一个大规模贴纸图像数据集,在六属性模式(外观、情感、动作、相机构图、风格、背景)下具有结构化标签。这些注释为不同的上下文提供了一致的界面,同时保持目标身份固定,从而能够对身份解开和上下文可控性进行系统评估。实验表明,海豹突击队在保持上下文可控性的同时,始终如一地改进了身份保留,凸显了测试时适应过程中明确的空间和结构约束的重要性。代码、StickerBench和项目页面将公开发布。