论文

FedSSMCoOp:联邦视觉语言提示学习的状态空间协同

FedSSMCoOp: SSM Encoders for light-weight Federated Prompt Learning for Few-shot Classification

模型训练模型架构SSM参数高效训练

摘要

得益于各个领域中包含的补充信息,视觉语言模型 (VLM) 在广泛的下游视觉任务中表现出了强大的性能。尽管性能有所提升,但这些方法大多数依赖于使用余弦相似性度量来对齐这些域,这无法在分类阶段之前捕获Token级结构和跨模式交互。这在联合约束下的生物医学应用中尤其重要,在联合约束下,数据共享受到限制,每个站点的标记数据稀缺,并且不同机构之间的数据差异很大,导致显着的统计异质性。为了克服这个问题,我们提出了 FedSSMCoOp,这是一种联合的少样本图像分类框架,可以在保护数据隐私的同时实现多模式学习。借助基于 SSM 的 Vision Mamba 和 Cross Mamba 块,并通过仅优化联合设置中的软提示和通信提示更新,该框架优先考虑计算和性能。重要的是,这消除了使用 用于功能对齐的外部大语言模型 (LLM)。该框架在各种生物医学图像数据集上进行了进一步的训练和评估,并评估了其性能。所提出的框架相对于基线提供稳定的性能,并且平均轻 1.96 倍。相应的脚本将很快发布。

FedSSMCoOp:联邦视觉语言提示学习的状态空间协同:论文原图
图 1:提议的 FedSSMCoOp 框架的架构。在每个客户端上,冻结的 Vison Mamba 编码器生成图像标记 VV,而文本编码器生成文本标记 TT。 COMO 块将两个流双向融合为文本感知和图像感知特征,这些特征经过均值池化形成 Prstudent\mathrm{Pr}_{student} ,并使用交叉熵损失 ℒCE\mathcal{L}_{CE} 进行优化。仅将提示参数发送到服务器进行聚合。