论文

PERL:CLIP 潜在空间中的参数高效推理

PERL: Parameter Efficient Reasoning in CLIP Latent Space

模型训练参数高效训练

摘要

对比训练的视觉语言模型(例如 CLIP)通过在共享嵌入空间中对齐图像和文本来提供强大的零样本传输。然而,在不降低开放词汇泛化能力的情况下使这些模型适应下游任务仍然具有挑战性。现有的参数高效适应方法通常通过学习提示、适配器或多模态转换来提高任务专业化,其中适应能力主要通过额外的可训练参数来表达。受最近语言模型中潜在推理方法的启发,我们研究了一个互补的观点:适应是否可以通过对潜在表示的迭代推理而不是仅通过增加参数计数来产生?我们引入了 PERL(CLIP 潜在空间中的参数高效推理),这是一种轻量级适应框架,它通过跨细化步骤循环应用的紧凑共享推理模块来增强冻结的 CLIP 模型。在每一步中,PERL 都会生成一个以当前表示为条件的潜在推理标记,并将其注入中间编码器层,逐步细化更高级别的语义表示,同时保留 CLIP 的预训练多模态结构。在跨越基础到新颖泛化、跨数据集传输和分布外 ImageNet 变体的 15 个基准测试中,PERL 在快速适应少样本设置下实现了比较方法中的最佳参数性能权衡,将强大的新颖类精度和具有竞争力的传输性能与仅约 6K 的可训练参数相结合,比最大的比较方法少了 817 倍。总的来说,我们的结果表明,迭代潜在推理为判别性视觉语言模型中的参数缩放提供了一种补充的适应机制。