论文

视觉语言模型微调中的语义能力获取与专化

Semantic Capability Acquisition and Specialization During Vision-Language Model Fine-Tuning

模型评测模型行为与机制分析

摘要

微调视觉语言模型 (VLM) 通常在单个下游检查点上进行评估,从而模糊了语义能力是否从未获得或在专业化过程中较早出现并随后下降。我们询问语义能力是如何获得的、它们何时达到峰值、它们的转移效果如何以及部署时还剩下什么。我们将这些动态研究为语义能力轨迹,通过训练跟踪基于身份和属性的能力。我们制定了一个基于轨迹的框架,将能力获取、特定于能力的最优和后来的专业化分开,并引入结构化语义路由(SSR)来研究监督的表示如何塑造所获取的内容。在涵盖 DFN、MetaCLIP 和 OpenAI CLIP 的六个预训练骨干模型 中,我们表明微调可以获得超出预训练状态的语义能力,包括在 保留测试 评估中观察到的增益。非结构化名称和属性监督产生强大的名称和属性检索,而无名称属性配置文件检索相对较弱,而 SSR 产生更强的无名称属性配置文件检索,并通过随机名称分支丢失进一步加强。不同的能力可以在不同的阶段达到峰值,因此目标类名检索选择的检查点不需要与可转移的语义最优值一致。因此,持续优化可以保留强大的目标类名检索,同时减少先前获得的可转移语义能力。在一项代表性的诊断研究中,这种晚期专业化与减少的跨模式语义可访问性是一致的,同时大量的仅图像类结构仍然可用。

视觉语言模型微调中的语义能力获取与专化:论文原图
图 1:监督表示、训练路径和能力 探针。 (a) N 使用仅名称监督,U 将类名和属性编码在一个普通文本流中,SSR/SSR+ND 使用结构化 NAME 和 ATTRIBUTE 段,并为 CUB/NAB 共享 CONCEPT 段。 (b) N/U 训练和所有评估均使用标准 CLIP 因果文本路径; SSR/SSR+ND 使用路由因果注意力和仅训练的 NAME、池属性和 EOT 摘要融合,以及 SSR+ND 的 NAME-summary dropout。 (c) 精确的 P1-P3 提示和 CAPP 反事实比较。照片:CUB-200-2011。