论文
DetailAnywhere:通过跨模式特征对齐生成时尚细节 蒸馏
DetailAnywhere: Fashion Detail Generation via Cross-Modal Feature Alignment Distillation
摘要
基于扩散的生成式人工智能在虚拟试穿、海报生成、产品背景合成等电子商务应用中取得了显着的成功。然而,在在线购买服装时,消费者还希望能够自由地检查感兴趣的特定细节区域,例如衣领、袖口和织物纹理,但现有方法尚未明确研究这种设置。因此,我们正式确定了一项新的非模板任务:具有焦点调节的时尚细节生成,并发布了 FDBench,这是第一个基准测试,包含 41 个不同类别的 40K 多个经过人工验证的参考细节对。这项任务提出了独特的语义差距挑战:模型必须在产品参考图像上的焦点标记与指示区域的逼真特写视图之间建立对应关系,同时在没有任何精确提示的情况下忠实地保留服装的身份。为了弥补这一差距,我们提出了跨模态特征对齐 蒸馏 (CFAD),它利用微调的 DINOv3 教师通过双分支 蒸馏 在共享语义空间中对齐多模态扩散 Transformer 的两个分支。为了进一步提高生成的细节和参考图像之间的一致性,我们引入了一种一致性奖励模型,该模型沿着三个质量轴联合对图像对进行评分,并通过强化学习来优化生成。实验表明,我们的模型 DetailAnywhere 在所有指标和人工评估方面均显着优于所有最先进的开源方法。