论文

无需训练 具有提示感知权重的多概念 LoRA 组合

Training-Free Multi-Concept LoRA Composition with Prompt-Aware Weighting

模型优化模型合并

摘要

低秩适应 (LoRA) 通过使预先训练的扩散模型适应特定的视觉概念和风格,成功实现了文本到图像生成的个性化。然而,将此类模型扩展到多概念定制仍然具有挑战性。简单地组合多个 LoRA 权重或其输出通常会导致概念之间的干扰,从而导致视觉质量下降并降低各个概念的参考图像的保真度。本文通过优化组合多个 LoRA 模块的输出,提出了一种简单而有效的多概念定制方法。我们在生成过程中利用每个概念的相对重要性,从其相应的提示标记推断出来,并引入两种方法,W-Switch 和 W-Composite,它们采用提示感知重要性加权策略,其中每个 LoRA 根据其触发词在目标提示中的语义影响进行加权。此外,我们通过提出一种新的基于图像的相似性评估框架来扩展现有的定量评估指标,该框架通过比较现实世界的参考图像和生成图像中自动分割的概念区域来评估图像保真度和身份保留。我们在 ComposLoRA 测试台上评估我们的方法,并在视觉质量、身份保留和组合性方面展示对现有最先进方法的持续改进。定性评估,包括基于 大语言模型 (LLM) 的评估和用户研究,进一步验证了所提出方法的有效性,并与新引入的基于图像的定量指标保持一致。我们的代码可在 https://github.com/GeorgeTsoumplekas/Prompt-Aware-Multi-LoRA-Composition 获取。