论文

重新思考特定领域中基于文本的图像检索

Rethinking Text-Based Image Retrieval in Specific Domain

模型训练监督微调与指令调优

摘要

在视觉语言表示学习快速发展的推动下,基于文本的图像检索(TBIR)取得了显着的进展。然而,现有的基准主要是基于查询和图像之间唯一的单匹配假设构建的。虽然在一般情况下有效,但这种假设无法反映特定领域(例如监控)中的实际系统性能,其中单个查询通常对应于多个相关候选图像。为了解决这个限制,我们设计了一个基于领域特定多重匹配文本的图像检索(DSMM-TBIR)数据引擎。利用该引擎,我们构建了安全多匹配 TBIR (SecMM-TBIR),这是一个包含 50k 监控图像和 200 个综合查询的基准。此外,我们观察到特定领域中的普通对比学习会遭受严重的假阴性,迫使模型将语义上相似的对分开,从而降低检索性能。我们提出了语义感知 微调 (SAFT) 框架来解决特定领域的语义压缩问题,该框架结合了语义感知软标签监督 (SASS) 和模内结构 蒸馏 (ISD) 来为特定领域的 TBIR 任务建立一个有前景的范例。跨各种类 CLIP 模型的实验表明,SAFT 在 SecMM-TBIR 上比标准图像文本对比 (ITC) 微调 的平均 mAP@20 增益提高了 7.8 个点,同时还提高了通用域性能。整个基准测试将被发布以促进进一步的研究。