论文
C2P-VAR:视觉自回归模型中的持续和组合个性化
C2P-VAR: Continual and Compositional Personalization in Visual Autoregressive Models
摘要
视觉自回归 (VAR) 模型最近已成为文本到图像生成的有效范例,但其个性化功能在很大程度上仍仅限于静态、单一概念设置。在实践中,用户可能不断引入新概念并希望在单个图像中组合多个个性化概念。这种场景提出了两个基本挑战:顺序个性化过程中的灾难性遗忘和多概念组合过程中的特征干扰。在这项工作中,我们研究了 VAR 模型中的连续个性化和组合个性化,并提出了 C2P-VAR,这是一个解决这两个挑战的统一框架。为了持续个性化,我们引入了 C2PVAR-S,它从梯度幅度中识别概念相关参数,并在训练期间动态更新它们的选择。为了保留以前学习的概念,C2PVAR-S 仅对当前和历史概念共享的参数应用正则化,从而减少不必要的干扰,而无需引入额外的模型组件。对于多概念个性化,我们进一步提出了C2PVAR-M,它采用并行的全局和特定于概念的分支以及空间局部特征融合和logits聚合来实现可控的概念放置并减少特征纠缠。关于连续和多概念个性化的大量实验表明,C2P-VAR 在主题保真度方面始终优于现有基线,同时保持有竞争力的文本对齐并引入可忽略不计的存储和推理开销。我们的结果为视觉自回归模型的可扩展和可控个性化建立了统一的框架。