论文

ZOMP:视觉语言模型的零阶多模态提示调整

ZOMP: Zeroth-Order Multi-Modal Prompt Tuning for Vision-Language Models

模型训练参数高效训练

摘要

微调 视觉语言模型(例如 CLIP)通常需要通过整个模型进行反向传播 (BP),当仅提供前向访问时,这是不可行的,这对于内存受限的边缘设备和专有模型部署来说很常见。先前的无BP、零阶提示调整方法避免了这一要求,但通常以单一模态调整提示或在足够大的搜索空间上进行优化,以致收敛需要数千次前向传递,这在实际查询预算下是不切实际的。我们提出了 ZOMP(零阶多模态提示调整),这是一种查询高效、完全仅向前的方法,它使用同时扰动随机近似来调整冻结 CLIP 模型的视觉和文本分支中的深度提示。 ZOMP 结合了三个要素:跨模式低秩重新参数化,通过共享因子将两个分支联系起来,并保持有效搜索维度较小;梯度校正动量项,稳定噪声零阶估计;以及预算索引排序计划,在查询预算耗尽时释放容量。在匹配的 5,000 个查询预算下的 13 个视觉语言基准测试中,ZOMP 在少数样本准确性和查询效率方面始终优于先前的无 BP 提示调整方法,并且它在基础到新、跨数据集传输和分布外设置方面具有更好的泛化能力。我们的结果表明,联合利用多模态和低秩结构是实现实用、查询高效、无 BP 提示调整的有效途径。