论文

FashionLens:通过任务自适应学习实现多功能时尚图像检索

FashionLens: Toward Versatile Fashion Image Retrieval via Task-Adaptive Learning

摘要

时尚图像检索是现代电子商务系统的基石。实践中非常需要一个支持多种查询格式和搜索意图的统一框架。然而,现有的方法专注于狭窄的检索任务,并没有完全捕捉这种多样性。因此,在这项工作中,我们的目标是开发一个能够处理各种现实时尚检索场景的统一框架,实现真正多功能的时尚图像检索。为了建立数据基础,我们首先引入 U-FIRE,这是一个综合基准测试,它将分散的时尚数据集整合为统一的集合,并辅以两个手动整理的数据集来测试泛化。在此基础上,我们提出了 FashionLens,一个基于 Multimodal 大语言模型 的统一框架。为了处理不同的匹配目标,我们设计了一个提案引导的球形查询校准器,它通过自适应球形线性插值动态地将查询表示转移到任务对齐的度量空间中。此外,为了减轻由不同的任务复杂性和数据规模引起的优化不平衡,我们开发了一种梯度引导自适应采样策略,该策略根据实时学习难度和先验数据规模自动重新加权任务。 U-FIRE 上的实验表明,FashionLens 在不同的检索场景中实现了最先进的性能,并且可以稳健地推广到未见过的任务。数据和代码公开发布于https://github.com/haokunwen/FashionLens。