论文
视觉分布锚定可实现高效及时调整
Visual Distribution Anchoring for Efficient Prompt Tuning
摘要
提示调整适应具有很少可训练参数的视觉语言模型,但现有方法会权衡效率和适应性:静态文本提示可能会过度拟合源类,图像条件提示会增加每个实例的计算,而多模式调整会修改视觉分支。我们提出了 VDA(视觉分布锚定),这是一种 无需训练 目标适应框架,它通过从未标记的目标池离线估计的类级视觉原型来增强冻结语义分类器。我们首先问是否可以从类名合成原型。文本到质心映射器重建保留的源原型,但在数据集转换下失败,因为类名指定语义标识,而不是目标域外观。预言机分析证实,真正的目标原型具有高度辨别力。因此,VDA 使用冻结语义和域模板分类器将未标记的目标图像划分为类相关组。置信度排名的图像特征形成归一化原型,并使用一个全局权重与语义分类器融合。适应不需要目标标签、目标端优化、统一类先验假设、迭代细化或测试查询访问,并产生固定的、可缓存的分类器。对照实验表明,特定于类的分区会带来收益,并且视觉上的局部伪标签错误尽管是类不正确的,但仍然有用。在 10 次 ImageNet 到目标的传输中,相同的冻结设计将零样本 CLIP、TCP 和 MaPLe 分别提高了 3.22、3.39 和 3.35 个点,在每种设置中提高了十个目标中的九个。其视觉校正进一步将无泄漏 PromptKD 提高了 2.79 点,补充了零样本、源提示、多模态提示和目标蒸馏分类器。