论文

多意图多轮时尚图像检索

Diverse-Intent Multi-Turn Fashion Image Retrieval

模型评测基准与评测资源

摘要

现实世界的时尚搜索涉及多轮交互检索。然而,现有的多轮检索方法建立在一个限制性假设之上,即每次交互都遵循相同的属性编辑范式,从而导致异构意图转换未被探索。此外,现有方法通常依赖文本化来桥接多模式查询和视觉检索,这可能会丢失细粒度的视觉线索。为了解决这些差距,我们引入了 DIM-Fashion,这是一个 26K 多回合会话的基准,由跨 7 个任务的 13 个时尚检索数据集构建,具有不同的意图转换和回滚行为。我们进一步提出了 FashionAM,这是一种 MLLM-VLP 框架,可直接将多模式会话查询与面向时尚的图库嵌入空间对齐,避免中间文本化。大量实验证明了 FashionAM 相对于现有方法的有效性。数据集和代码将在接受后公开发布。