论文
SeCo-SBIR:基于零样本草图的图像检索的语义一致即时学习
SeCo-SBIR: Semantically Consistent Prompt Learning for Zero-Shot Sketch-Based Image Retrieval
摘要
通过即时学习将 CLIP 应用于基于零样本草图的图像检索 (ZS-SBIR) 面临着一个根本性的张力:模型必须通过特定于任务的适应来弥合草图-照片域差距,但增加的灵活性可能会过度拟合所见的训练类别,并削弱 CLIP 的零样本泛化能力。我们提出了 SeCo-SBIR,这是一个语义一致的即时学习框架,可以解决双方的这种紧张关系。首先,文本引导的多模式提示策略通过 CLIP 的文本编码器路由可学习的提示向量,并通过可学习的耦合函数将生成的中间表示投影到每一层的视觉编码器中。由于文本编码器已经从大规模语言监督中学习了强大的、抽象的类别级语义,因此该机制将可转移的语义知识直接注入视觉路径中——使模型适应草图照片领域,同时本质上有利于对未见过的类的泛化。其次,基于扰动的一致性约束通过使用非对称 InfoNCE 目标将适应模型与冻结 CLIP 参考分支对齐来解决可学习耦合函数的残余过拟合风险 - 增强输入馈送到冻结分支,而干净输入馈送到可训练分支 - 将学习表示锚定到 CLIP 的可泛化特征空间。与轻量级适配器和结合三元组、NT-Xent 和分类术语的多目标损失一起,SeCo-SBIR 在所有三个标准 ZS-SBIR 基准测试中跨分类、广义和跨数据集设置实现了最先进的结果。