论文

MAIL++:视觉语言模型的多模式双向代理层

MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models

模型训练参数高效训练

摘要

将 CLIP 等大型视觉语言模型 (VLM) 应用于下游任务仍然具有挑战性,因为完整的 微调 的计算量巨大,并且在低数据情况下容易过度拟合。参数高效的 微调 (PEFT) 通过轻量级提示或基于适配器的模块缓解了这些问题,并且跨模式耦合通过加强视觉和语言之间的交互已被证明特别有效。然而,现有的耦合机制主要依赖于外部辅助模块,导致间接的、粗粒度的交互,这些交互在结构上与原始的VLM解耦,从而限制了表征的表达能力。在本文中,我们提出了多模态交互代理层(MAIL),这是一种将跨模态耦合直接嵌入到 VLM 的内在计算模块中的 PEFT 范例。 MAIL 冻结主干,并在核心模块(例如 LayerNorm)之后插入轻量级代理层,以近似由完整 微调 引起的参数更新。为了在这个级别耦合视觉和文本流,我们引入了基于瓶颈的文本到图像桥,该桥联合优化跨模态的成对代理层,协调相应计算模块的适应。我们进一步提出了 MAIL++,它通过元代理层、元文本桥和元图像桥实现双向跨模式交换。在推理时,所有代理层都被重新参数化到冻结的主干中,从而保留了原始的计算效率。对少样本图像分类和少样本通用跨域检索的大量实验表明,MAIL 和 MAIL++ 始终优于最先进的 PEFT 方法。