论文

走向联合多模态图基础模型:拓扑感知的多模态对齐框架

Toward Federated Multimodal Graph Foundation Models: A Topology-Aware Multimodal Alignment Framework

模型训练预训练

摘要

多模态属性图(MAG)的节点除了拓扑结构之外还承载图像和文本等模态,现在遍及社交平台、电子商务和生物医学网络等应用,提供比单模态图更丰富的语义信号。在实践中,这些图分散在不同平台和机构拥有的隐私受限的孤岛中,因此学习一个可广泛转移的模型需要进行协作训练,而绝不能暴露原始数据。这将任务置于多模态图学习和联邦学习的交叉点,但现有方法只涵盖了它的一方面。为了从这两个角度解决挑战,我们提出了 FedGAMMA,将联邦多模态图基础学习转化为联邦 预训练 和基于提示的 微调 的两阶段语义结构对齐问题。在 预训练 期间,共享-私有语义增强器将跨模态共性与模态特定信息分离,通过最佳传输对其进行对齐,拓扑感知图融合模块通过语义残差图和双位置编码解耦语义和结构视图,双通道亲和力感知聚合机制根据特征和图质心估计客户端相似性,而无需暴露原始数据。在 微调 期间,FedGAMMA 通过轻量级图形感知提示、具有受控探索的共享提示池以及通道方式提示同步来调整预训练编码器。对 12 个多模态图数据集进行的实验表明,FedGAMMA 在下游任务中始终超越了广泛的基线,增益高达 12.96%。 FedGAMMA 在多个任务的多域数据集上进一步优于竞争基线,在少样本学习场景下高达 5.71%。