论文
超越标量距离:用于视觉嵌入的冻结 MLLM 的语义属性梯度
Beyond Scalar Distances: Semantic Attribute Gradients from Frozen MLLMs for Visual Embeddings
摘要
用于检索的视觉编码器通常使用类标签监督进行训练:每个训练对都简化为一个标量,该标量均匀地将嵌入推开或将其拉在一起,就好像每个视觉属性都不同或匹配一样。显示同一对的多模态 大语言模型 (MLLM) 可以阐明这些属性并使用它们来预测图像是否共享一个类别。我们提出 \textbf{SAGA},一个框架,它将这种基于语言的、属性感知的感知转化为编码器本身的训练信号。具体来说,我们使用组相对策略优化 (GRPO) 来奖励 MLLM 对视觉编码器词元的正确预测。由于正确的预测需要这些标记暴露对之间不同或匹配的特定属性,因此梯度推动编码器对它们进行编码,用属性解析的监督替换统一的对级标量。辅助注意力 蒸馏 损失将编码器的嵌入锚定到 MLLM通过注意力选取的词元,标准度量学习损失塑造用于最近邻检索的嵌入几何形状。 MLLM 在整个过程中被冻结并在推理时被丢弃,这与度量学习基线的部署成本相匹配。 SAGA 在零样本图像检索方面将 Recall@1 比 CUB-200-2011、Cars-196、FGVC-Aircraft 和 iNaturalist Aves 的最先进基线提高了 3 到 6 个点。