论文

VietFashion:文化服装草图文本合成图像检索的基准测试

VietFashion: Benchmarking Sketch-Text Composed Image Retrieval for Cultural Outfits

模型评测基准与评测资源

摘要

文化服装对视觉检索系统提出了独特的挑战,因为它们的身份通常取决于标准人工智能模型很难捕获的微妙结构和符号细节。我们介绍 VietFashion,这是一个以越南传统服装 Ao Dai 为中心的草图文本组成图像检索的新基准。 VietFashion 使设计师和研究人员能够使用传达服装结构的手绘草图和编码文化语义的文本描述相结合来检索具有文化意义的服装。该数据集使用 650 个草图进行初始化,并使用生成模型进行扩展,以生成超过 21,000 个带有配套图像描述的逼真图像。描述详细服装属性的文字提示,这些属性摘自时尚杂志,以确保真实性和多样性。为了更好地反映设计意图固有的模糊性,VietFashion采用了多目标检索设置,其中单个查询可能对应于多个有效结果。我们建立标准化的评估协议和基准最先进的组合图像检索方法。实验结果揭示了细粒度文化语义和多模态构成建模方面的显着性能差距,将 VietFashion 定位为细粒度时尚检索的具有挑战性的基准。该数据集可在以下网址公开获取:https://hng0303.github.io/VietFashion。