论文

FedMPT:视觉语言模型的联邦多标签提示调优

FedMPT: Federated Multi-label Prompt Tuning of Vision-Language Models

模型训练参数高效训练

摘要

基于视觉语言模型(VLM)的多标签识别(MLR)旨在利用其预训练知识更好地适应复杂识别场景,从而增强模型鲁棒性。然而,对于需要联邦学习的现实去中心化应用,将VLM适配到各自拥有私有且异构数据的客户端,会使模型过拟合虚假的标签相关性,进而在遇到新样本时触发不相关的类别。为解决这一问题,我们用因果模型重新审视面向MLR的联邦学习,采用前门调整,并通过放大真值标签共现的中间变量来解耦MLR建模过程。在上述分析的指导下,我们提出FedMPT,这是首个专为联邦MLR设计的方法。FedMPT的核心思想是利用可泛化的条件来引导联邦MLR,以减轻错误的标签激活。为实现这一点,FedMPT引入一个由大语言模型(LLM)驱动的流水线来破译支配标签依赖的底层条件。此外,我们在条件增强的提示与图像块之间引入最优传输,以挖掘多个区域级语义。最后,我们用精心设计的门控机制从不同条件生成协同预测。在多个基准数据集上的实验表明,所提方法取得了有竞争力的结果,并在多种设置下超越SOTA方法。

FedMPT:视觉语言模型的联邦多标签提示调优:论文配图
图 1:(a):“Cat”的类激活图与训练图像(a,上)和测试图像(a,下)的 top-3 预测的比较。现有的 SOTA 很容易出现过度拟合虚假相关性(即猫椅)并在 FL 下转移注意力,而我们的 FedMPT 有效缓解了这些问题。 (b):随着数据异质性的增加,现有的 SOTA 表现出显着的退化,而我们的 FedMPT 则表现出相当的稳健性。