论文
Fashion130K:具有统一多模态条件的服装生成电子商务时尚数据集
Fashion130K: An E-commerce Fashion Dataset for Outfit Generation with Unified Multi-modal Condition
摘要
最近关于时尚服装生成的研究工作重点是通过利用参考图像和文本提示中的关键信息来提高服装的视觉一致性。然而,服装生成的潜力仍未得到充分开发,需要全面的电子商务数据集和多模式条件的精心利用。在本文中,我们提出了一个全新的电子商务数据集,名为 Fashion130k,包含各种场合、模特和服装类型。为了一致地生成服装,我们设计了一个具有统一多模态条件(UMC)的框架,将文本和视觉提示对齐并集成到生成模型中。具体来说,我们探索了一种嵌入细化器来提取多模态提示的统一嵌入,其中提出了 Fusion Transformer 通过调整文本和图像之间的模态间隙来对齐多模态嵌入。基于统一嵌入,重新设计了生成模型中的注意力,以强调提示和噪声图像之间的相关性,从而使噪声图像可以选择提示的关键标记以实现一致的服装生成。我们的数据集和提出的框架为生成模型的多模式提示提供了一般而细致的探索。对实际应用和基准的大量实验证明了 UMC 在视觉一致性方面的有效性,取得了比 SoTA 方法更好的结果。