论文
为时尚互补图像生成提供自由形式的指导
Grounding Free-Form Instructions for Fashion Complementary Image Generation
摘要
时尚互补图像生成 (CIG) 旨在根据用户意图创建在风格上与种子项目相匹配的服装,使其成为一个自然的多模态基础问题,其中模型必须在视觉上下文中解释语言。现有的 CIG 基准依赖于严格的模板提示(例如,“裙子的照片”),无法反映自然的用户查询,并且模糊了跨语言特异性级别的模型行为。我们引入了具有自由格式指令的时尚互补图像生成,这是一种多模式语言基础设置,其中模型根据种子图像和自然语言指令生成兼容的服装。为此,我们通过视觉语言模型生成并由人类注释者验证的低、中和高特异性指令丰富了三个 CIG 基准。我们使用 StyleFlow 来实例化该任务,StyleFlow 是一种整流流匹配模型,它在单个多模态 Transformer 内联合调节种子图像和指令。在图像质量指标、目录对齐分析、消融和人工评估方面,StyleFlow 始终如一地生产指令对齐且风格一致的服装,同时相对于辅助模块方法降低了架构复杂性和推理成本。