论文
使用级联语义调整视觉基础模型
Adapting Vision Foundation Models with Cascaded Semantics
摘要
即时调优是 NLP 中领先的参数高效适应范例,最近已扩展到计算机视觉。视觉提示调整 (VPT) 通过更新一小组附加提示参数来适应预先训练的视觉 Transformer (ViTs)。然而,现有的视觉提示是随机初始化的,并且没有利用先验知识,例如 NLP 中的指令。我们通过在 VPT 中注入两个互补的语义先验来解决这一差距。基本图像先验,包括颜色、纹理和形状,是用经典的手工操作符提取的,并注入到输入空间中,而自注意力图在特征空间中提供实例感知语义。我们进一步提出了一个级联方案,在整个 ViT 适应过程中整合两个先验。对 34 个具有挑战性的图像分类数据集进行的实验证明了卓越的下游适应能力,同时仅调整了 0.74% 的 ViT 参数。项目页面:https://xixiaouab.github.io/Cascaded-Semantics/。