论文
具有固定词元基础的视觉语言模型的低秩快速学习
Low-Rank Prompt Learning for Vision-Language Models with Fixed-Token Bases
摘要
即时学习通过用学习的连续上下文向量替换手写模板,使 CLIP 适应下游识别,这些向量在上下文优化 (CoOp) 中形成一个密集的提示矩阵 $\mathbf{P}\in\mathbb{R}^{m\times d}$,每类仅使用几个示例进行训练。我们通过将其分解为 $\mathbf{P}=\mathbf{B}\mathbf{A}$ 来研究该矩阵是否过度参数化,这将可训练提示参数从 $md$ 削减为 $r(m+d)$,一旦词元侧因子 $\mathbf{B}$ 固定,则将可训练提示参数削减为 $rd$。在七个少样本基准测试和两个 CLIP 主干中,低秩提示可以在少得多的参数下匹配或改进密集 CoOp,并且在低样本基础到新泛化方面获得最明显的收益。然后我们发现词元侧因子根本不需要学习:将 $\mathbf{B}$ 固定为高斯、正交、SVD 导出甚至随机基础,并且仅训练嵌入侧因子 $\mathbf{A}$ 与完全可训练的分解保持一致,并且源训练的 $\mathbf{B}$ 与随机因子相比没有任何优势。提示因子不对称性和局部更新空间维度差距说明了为什么修复 $\mathbf{B}$ 的限制远小于修复 $\mathbf{A}$ 的限制,并且仅平滑保证证明在固定 $\mathbf{B}$ 上优化 $\mathbf{A}$ 是收敛的。在CLIP提示设置中,嵌入端系数带有自适应性,而词元基可以简单地固定。