论文
压缩多模态 大语言模型 的容量以实现主题驱动生成
Squeezing Capacity from Multimodal Large Language Models for Subject-driven Generation
摘要
主题驱动的图像生成旨在合成新图像,在遵循文本指令的同时保留给定主题的身份。现有方法通常分别对文本和参考图像进行编码。这限制了跨模式推理能力并导致复制粘贴伪影。最近连接多模式模型和扩散模型的框架改善了指令遵循,但在很大程度上忽视了身份保存。为了解决这些限制,我们在多模态 大语言模型 (MLLM) 上调节扩散模型,该模型联合编码文本和参考图像,并通过基于 VAE 的身份调节对其进行增强。新颖的双层聚合(DLA)模块旨在聚合多级 MLLM 特征以实现最佳调节,并应用多级去噪策略在推理过程中逐步平衡来自 MLLM 的语义信息和来自 VAE 的精细细节身份。大量的实验表明,我们的方法将多模态理解与身份保存相协调,减轻了复制粘贴问题,并在人类对主题驱动图像生成的偏好方面实现了卓越的性能。我们的项目网站位于 https://zsh2000.github.io/squeeze-mllm-subject-gen/。