论文
Unify-Agent:用于全球图像合成的统一多模态代理
Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis
摘要
统一的多模态模型提供了一种自然且有前途的架构,用于理解多样化和复杂的现实世界知识,同时生成高质量的图像。然而,他们仍然主要依赖于冻结的参数知识,这使得他们难以应对涉及长尾和知识密集型概念的现实世界图像生成。受到代理在现实世界任务中取得的广泛成功的启发,我们探索代理建模来解决这一限制。具体来说,我们提出了 Unify-Agent,这是一种用于基于世界的图像合成的统一多模态代理,它将图像生成重新构建为由即时理解、多模态证据搜索、基于基础的重述和最终合成组成的代理管道。为了训练我们的模型,我们构建了一个定制的多模态数据管道,并为基于世界的图像合成策划了 143K 高质量智能体轨迹,从而能够对整个智能体生成过程进行有效监督。我们进一步介绍了 FactIP,这是一个涵盖 12 类具有文化意义和长尾事实概念的基准,明确需要外部知识基础。大量实验表明,我们提出的 Unify-Agent 在不同基准和现实世界生成任务上大大改进了其基本统一模型,同时接近最强闭源模型的世界知识能力。作为基于代理的基于世界的图像合成建模的早期探索,我们的工作强调了紧密耦合的推理、搜索和生成对于可靠的开放世界代理图像合成的价值。