论文
UniCustom:用于多参考图像生成的统一视觉调节
UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation
摘要
多参考图像生成旨在根据文本指令合成图像,同时忠实地保留多个参考图像中的主体身份。现有的 VLM 增强扩散模型通常依赖于解耦的视觉调节:语义 ViT 特征由 VLM 处理以进行指令理解,而外观丰富的 VAE 特征稍后注入扩散主干。尽管其设计直观,但这种分离使得模型很难将每个基于语义的主题与正确参考图像中的视觉细节相关联。因此,模型可能会识别正在引用哪个主题,但无法保留其身份和细粒度外观,从而导致复杂的多引用设置中的属性泄漏和交叉引用混乱。为了解决这个问题,我们提出了 UniCustom,一个统一的视觉调节框架,在 VLM 编码之前融合 ViT 和 VAE 功能。这种早期融合将 VLM 暴露给语义线索和外观丰富的细节,使其隐藏状态能够仅使用轻量级线性融合层对所涉及的主题和相应的视觉外观进行联合编码。为了学习这种统一的表示,我们采用了两阶段的训练策略:面向重建的预训练,在融合的隐藏状态中保留参考特定的外观细节,然后对单参考和多参考生成任务进行监督微调。我们进一步引入了按槽绑定正则化,鼓励每个图像槽保留其相应参考的低级细节,从而减少交叉参考纠缠。两个多参考生成基准的实验表明,UniCustom 在强基线上持续提高了主题一致性、指令遵循性和成分保真度。