论文

MQAdapter:用于从粗到细 VLM 的多模态量子适配器 微调

MQAdapter: Multi-Modal Quantum Adapter for Coarse-to-Fine VLM Fine-tuning

模型训练参数高效训练

摘要

大规模视觉语言模型在广泛的任务中展示了令人印象深刻的迁移学习能力。对于少样本分类,我们观察到 VLM 表现出过滤候选类别的显着能力,从而实现高 Top-K 准确度。然而,它们经常在视觉相似类别之间进行细粒度区分,导致 Top-1 性能不理想,如图 1 所示。现有的 VLM 适配器研究通常关注特征空间中视觉和文本表示之间的全局对齐,但未能利用语义相似类别来细化细粒度视觉表示。基于这些观察,我们提出了一种新颖的从粗到细的 VLM 微调 方法,用于利用量子计算的小样本学习,称为多模态量子适配器 (MQAdapter)。具体来说,MQAdapter 首先检索与输入图像最相似的 Top-K 类别候选,并将它们用作语义锚。然后,它采用跨模式量子学习机制在这些锚点的指导下细化视觉特征。该机制的核心是将视觉和文本特征编码为量子态。通过利用高维希尔伯特空间中的量子纠缠和叠加,MQAdapter 可以有效地模拟高阶跨模态交互,从而产生比传统欧几里得适配器更具辨别力的表示。 MQAdapter 具有参数高效性,可以与各种现有的 微调 算法集成,以实现进一步的性能提升。对 15 个数据集的评估证明了 MQAdapter 的有效性,同时需要更少的可训练参数。