论文

用于细粒度图像识别的视觉语言模型中的结构化压缩提示调整

Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition

模型训练参数高效训练

摘要

由于手动注释需要大量的专业知识和精力,细粒度图像识别提出了重大挑战。像 CLIP 这样的视觉语言模型 (VLM) 提供了一种引人注目的零样本替代方案,减少了对大量标记数据的依赖。然而,它们捕捉细微差别的能力仍然有限,导致识别性能不佳。虽然事实证明,即时调整对于适应 VLM 是有效的,但大多数现有方法将类标签视为孤立的、离散的实体,忽略了它们之间丰富的语义关系。这种过于简化的假设限制了模型捕获层次依赖性和类间相关性的能力——这两者对于区分视觉上相似的类别都至关重要。这个问题在细粒度分类中尤其严重,其中准确的识别取决于对复杂标签语义的理解。为了解决这个问题,我们提出了结构化压缩提示调整(SCPT),它增强了提示学习中的语义结构建模。具体来说,我们引入语义关系编码(SRE)来显式建模类间语义拓扑并编码结构化标签关系。同时,我们设计了语义压缩损失(ScLoss)来抑制冗余监督并从全局语义空间中提取判别成分。这些组件共同显着改善了语义对齐和细粒度区分。对 14 个细粒度基准的大量实验表明,SCPT 有效地减轻了语义歧义,并在少样本和从基础到小说的泛化设置中实现了最先进的性能。