论文
RankT2I:用于在文本到图像模型中发现可解释和多样化语义的子模块框架
RankT2I: A Submodular Framework for Discovering Interpretable and Diverse Semantics in Text-to-Image Models
摘要
文本到图像 (T2I) 模型的最新进展彻底改变了图像生成和编辑领域。然而,识别 T2I 模型可以在图像中成功编辑的语义仍然是一项具有挑战性的任务。大多数现有方法要求用户手动指定语义来修改特定图像,这是一个耗时的过程,通常涉及大量的试验和错误。在本文中,我们提出了 RankT2I,这是一种新颖的、与模型无关的 无需训练 框架,可以自动发现扩散和基于 FLUX 的模型中的可编辑语义。给定视觉领域,我们首先利用多模态视觉语言模型来收集广泛的候选语义。然后,我们将语义发现框架为一个集合选择问题,并使用子模块目标来识别相关的、可编辑的和多样化的语义。我们的方法可以帮助用户有效地识别跨多个领域的文本到图像编辑模型的广泛语义,同时优于现有方法。