论文
UniVerse:用于无分段、解开的多概念个性化的统一调制框架
UniVerse: A Unified Modulation Framework for Segmentation-Free,Disentangled Multi-Concept Personalization
摘要
个性化视觉理解取得了显着进步,但当输入图像包含多个对象时,现有方法很难定位和提取特定概念。许多现有方法严重依赖基于分割的监督或表现出较差的组合概括,限制了它们准确解开和操纵单个概念的能力。在这项工作中,我们提出了 UniVerse,一种统一调制框架,用于扩散 Transformer 中的无分割、解开的多概念个性化。我们的方法允许可组合和可分解的概念提取,无需显式分割掩模即可实现目标对象的细粒度定位和表示。 UniVerse 学习将复杂的场景分解为特定于概念的表示,然后以统一的方式组合它们,从而在不同的视觉上下文中实现强大的个性化。通过对多个基准的大量实验,我们证明 UniVerse 在定位精度和视觉保真度方面均显着优于最先进的基准。定性和定量结果表明,我们的方法可以在杂乱的场景中精确提取目标概念,为更灵活、可解释和个性化的视觉生成和理解铺平道路。