FedDP-PALD:一种具有用于医疗数据合成的原型聚合的隐私保护联合潜在扩散框架
FedDP-PALD: A Privacy-Preserving Federated Latent Diffusion Framework with Prototype Aggregation for Medical Data Synthesis
摘要
医学图像和生理信号为准确诊断提供了有价值的信息。尽管严格的隐私法规限制敏感临床记录的共享,但开发诊断模型通常需要来自多个机构的患者数据。联邦学习使多家医院能够在不交换原始数据的情况下训练共享模型。然而,现有方法面临两个问题:训练期间交换的信息可以揭示患者的数据是否被使用,而旨在取代真实记录的合成数据通常无法保留其预测结构,这限制了临床使用。为了解决这个问题,我们提出了 FedDP-PALD,一种保护隐私的联合潜在扩散框架,用于在正式隐私保证下进行多模式医疗数据合成。它通过带有模态可用性掩模的门控多头注意力联合处理胸部 X 射线图像和心电图 (ECG) 信号,即使在模态缺失时也保持有效。我们还引入了差分隐私原型混合聚合(DP-PMA),它会剪辑类级别的潜在原型并添加校准的高斯噪声,然后将它们在服务器上组合以维护 $(ε, δ)$ 差分隐私。我们在 PneumoniaMNIST、ChestMNIST 和 MIT-BIH 数据集上评估 FedDP-PALD,其中差分隐私将摘要级攻击 AUROC 从 0.6229 $\pm$ 0.0026 减少到 0.5016 到 0.5093 之间,隐私预算从 $ε= 1$ 到 $ε= 8$。在测试数据上,合成潜在训练的 F1 分数为 0.8993 $\pm$ 0.0006,AUROC 为 0.9057 $\pm$ 0.0503,接近真实潜在训练的 0.9747 $\pm$ 0.0132。这些结果表明,FedDP-PALD 生成私有合成表示,可以保留有用的决策性能,同时强烈抵制成员推理。