论文
FedSSMCoOp:联邦视觉语言提示学习的状态空间协同
FedSSMCoOp: SSM Encoders for light-weight Federated Prompt Learning for Few-shot Classification
摘要
得益于各个领域中包含的补充信息,视觉语言模型 (VLM) 在广泛的下游视觉任务中表现出了强大的性能。尽管性能有所提升,但这些方法大多数依赖于使用余弦相似性度量来对齐这些域,这无法在分类阶段之前捕获Token级结构和跨模式交互。这在联合约束下的生物医学应用中尤其重要,在联合约束下,数据共享受到限制,每个站点的标记数据稀缺,并且不同机构之间的数据差异很大,导致显着的统计异质性。为了克服这个问题,我们提出了 FedSSMCoOp,这是一种联合的少样本图像分类框架,可以在保护数据隐私的同时实现多模式学习。借助基于 SSM 的 Vision Mamba 和 Cross Mamba 块,并通过仅优化联合设置中的软提示和通信提示更新,该框架优先考虑计算和性能。重要的是,这消除了使用 用于功能对齐的外部大语言模型 (LLM)。该框架在各种生物医学图像数据集上进行了进一步的训练和评估,并评估了其性能。所提出的框架相对于基线提供稳定的性能,并且平均轻 1.96 倍。相应的脚本将很快发布。
