论文
USPLIT-VQA:利用贡献感知加权聚合进行视觉问答的 U 形分割学习
USPLIT-VQA: U-Shaped Split Learning for Visual Question Answering with Contribution-Aware Weighted Aggregation
摘要
联合解释图像和自然语言查询的视觉问答 (VQA) 系统在许多领域具有重大前景,但用户数据的隐私敏感性质造成了根本障碍。集中训练需要访问所有数据,而联邦学习则需要每个客户端托管完整模型。我们提出了 USPLIT-VQA,这是一种用于保护隐私的 VQA 的 U 形分割学习框架,其中每个客户端保留初始层和分类头,而服务器托管计算量大的中间层,将原始输入和标签保留在客户端设备上。我们进一步引入了贡献感知加权聚合(CAWA),这是一种基于梯度相似性的客户端评分机制,旨在减少恶意更新的影响。在具有两个主干的四个 VQA 数据集(VQA-RAD、SLAKE、PathVQA 和 VizWiz)上进行的实验表明,在评估的固定分割下,自定义模型的联邦学习的准确性有所提高,BiomedCLIP 的准确性降低,同时客户端内存减少了高达 5.8 倍,通信减少了高达 10.8 倍。对于一个恶意客户端,CAWA 将攻击者的影响力降低了 98% 以上,而在较高损坏级别的实验则发现了其局限性。重建实验进一步表明,在评估的攻击下,反演质量较低。