论文

S2Aligner:用于稀疏文本属性图的成对高效且可转移的 预训练

S2Aligner: Pair-Efficient and Transferable Pre-Training for Sparse Text-Attributed Graphs

模型训练预训练

摘要

文本属性图(TAG)上的 预训练 是构建可转移图基础模型的核心,其中 LLM-as-Aligner 方法通过 大语言模型 的语义知识来对齐图和文本表示。然而,这些方法通常假设节点文本提供充分且可靠的监督,而这一假设在现实世界的稀疏标签中经常被违反。当文本锚丢失、有噪声或跨域不均匀时,图结构必须与弱语义证据对齐,从而导致不可靠的结构语义对应和稀疏性引起的转移偏差。本文提出了 S2Aligner,一种稀疏感知和结构增强的 LLM-as-Aligner 框架,用于稀疏标签上的图文本 预训练。关键思想是将语义对齐与结构建模分离,允许拓扑感知信号增强对齐而不污染共享语义空间。具体来说,S2Aligner将图文本表示分解为语义和结构组件,使用具有一致性控制的面向结构的重建将可靠的拓扑线索注入到文本表示中,并在文本稀疏性下抑制不一致的结构信号。此外,S2Aligner引入了稀疏感知的跨域风险平衡,它通过全局域密度比来校准域风险,并通过图可靠性估计来降低不可靠稀疏样本的权重。理论分析表明,该目标通过控制领域风险差异来减少跨领域泛化差距。跨不同图域、稀疏级别和下游任务的大量实验表明,S2Aligner 始终优于现有基线。