论文
UniFed-VLM:具有多种异质性的视觉语言模型的联合指令调整
UniFed-VLM: Federated Instruction Tuning for Vision-Language Models with Multiple Heterogeneity
摘要
视觉语言模型(VLM)在多模态理解和生成方面表现出了强大的性能。然而,VLM 的 微调 通常依赖于集中式数据,这会引发某些领域(例如医疗保健)的隐私问题。联邦学习 (FL) 通过启用 模型训练 而不共享原始数据,提供了一种自然的解决方案。然而,将 FL 应用于 VLM 指令调整非常具有挑战性。 VLM 具有大量参数规模,在现实场景中,客户在任务、模式和模型架构方面表现出显着的异质性。现有方法主要侧重于简化设置,无法处理此类多维异构场景。在这项工作中,我们研究了任务、模式和模型架构联合异构下的联邦指令调整。我们提出了 UniFed-VLM,这是一种用于 VLM 的统一联合指令调整框架,可解决多种类型的异构性。它由两个关键组件组成:1)联合补偿子空间聚合(FedCSA),它通过动态加权和补偿来执行参数高效适配器的子空间对齐聚合,以减轻异质性引起的冲突; 2)两阶段协作蒸馏(TCoD),它可以通过相互蒸馏适配器(MDA)和基于专家混合的蒸馏策略实现跨异构模型的有效知识转移。我们在多个基准数据集上进行了实验,结果表明,与现有的 FL 方法相比,UniFed-VLM 在不同任务上实现了更强的平均性能。源代码位于:https://github.com/wangpengyu2004/UniFed-VLM。