论文
VersaVogue:统一时尚综合的视觉专家编排和偏好调整
VersaVogue: Visual Expert Orchestration and Preference Alignment for Unified Fashion Synthesis
摘要
扩散模型推动了时尚图像生成的显着进步,但之前的工作通常将服装生成和虚拟着装视为单独的问题,限制了它们在现实世界时尚工作流程中的灵活性。此外,多源异构条件下的时尚图像合成仍然具有挑战性,因为现有方法通常依赖于简单的特征串联或静态分层注入,这往往会导致属性纠缠和语义干扰。为了解决这些问题,我们提出了VersaVogue,这是一个多条件可控时尚合成的统一框架,共同支持服装生成和虚拟着装,对应于时尚生命周期的设计和展示阶段。具体来说,我们引入了一个特征路由注意力(TA)模块,该模块利用专家混合机制将条件特征动态路由到最兼容的专家和生成层,从而实现纹理、形状和颜色等视觉属性的解耦注入。为了进一步提高真实性和可控性,我们开发了一种自动化的多视角偏好优化(MPO)管道,该管道无需人工注释或特定于任务的奖励模型即可构建偏好数据。通过结合内容保真度、文本对齐和感知质量的评估器,MPO 识别可靠的偏好对,然后通过直接偏好优化 (DPO) 将其用于优化模型。对服装生成和虚拟着装基准的大量实验表明,VersaVogue 在视觉保真度、语义一致性和细粒度可控性方面始终优于现有方法。