论文

走向图结构数据的通用基础模型

Toward a universal foundation model for graph-structured data

模型训练预训练

摘要

图是生物医学研究的核心表现形式,捕获分子相互作用网络、基因调控回路、细胞间通讯图和知识图。尽管它们很重要,但目前还没有一个可广泛重用的可用于图分析的基础模型,可以与那些已经改变了语言和视觉的模型相媲美。现有的图神经网络通常在单个数据集上进行训练,并学习仅特定于该图的节点特征、拓扑和标签空间的表示,这限制了它们跨域传输的能力。这种缺乏概括性在生物学和医学领域尤其成问题,因为这些领域的网络在不同群体、分析和机构之间存在很大差异。在这里,我们介绍一种图基础模型,旨在学习不特定于特定节点身份或特征方案的可转移结构表示。我们的方法利用与特征无关的图属性,包括程度统计、中心性度量、社区结构指标和基于扩散的签名,并将它们编码为结构提示。这些提示与消息传递主干集成,将不同的图形嵌入到共享表示空间中。该模型在异构图上预训练一次,然后以最小的适应在未见过的数据集上重复使用。在多个基准测试中,我们的预训练模型匹配或超过了强监督基线,同时在保留图上展示了卓越的零样本和少样本泛化能力。在 SagePPI 基准上,预训练骨干网的监督 微调 的平均 ROC-AUC 为 95.5%,比最佳监督消息传递基线提高了 21.8%。因此,所提出的技术为生物医学和网络科学应用中的图结构数据提供了一种独特的可重用的基础规模模型。