论文

DiffGraph:面向真实场景文生图的自动化智能体驱动模型合并框架

DiffGraph: An Automated Agent-driven Model Merging Framework for In-the-Wild Text-to-Image Generation

模型优化模型合并

摘要

文生图(T2I)社区的快速增长催生了繁荣的在线专家模型生态,这些专家模型是预训练扩散模型针对多样生成能力特化的变体。然而,现有模型合并方法在充分利用丰富的在线专家资源方面仍然有限,且难以满足多样化的真实场景用户需求。我们提出DiffGraph,一个新颖的智能体驱动、基于图的模型合并框架,可自动利用在线专家模型并针对多样用户需求灵活地合并它们。DiffGraph构建一个可扩展的图,并通过节点注册与校准将不断增长的在线专家模型组织到图中。随后,DiffGraph根据用户需求动态激活特定子图,实现不同专家模型的灵活组合,以达到用户期望的生成效果。大量实验验证了该方法的有效性。

DiffGraph:面向真实场景文生图的自动化智能体驱动模型合并框架:论文配图
图 1:我们提出的方法的概述。我们的 DiffGraph 框架由三个关键组件组成:图构建代理 (GCA)、专家选择代理 (ESA) 和合并规划器 (MP)。在通用图构建阶段,为了便于理解,我们举一个简化的例子,GCA收集并组织N=8N=8个在线专家(索引为1-8),并在Nr=3N_{r}=3个参考提示上对其进行评估,进行节点校准。在动态子图激活阶段,ESA 解析用户需求并选择专家子集,例如 {3,4,5,7}\{3,4,5,7\} 来参与合并过程。然后MP激活相应的子图并生成合并系数,这些系数用于产生用于图像生成的最终合并模型。