论文

TaLK:通过具有图形感知内核的耦合语言模型获得文本属性图形数据集 蒸馏

TaLK: Text-attributed Graph Dataset Distillation via Coupling Language Model with Graph-Aware Kernel

模型训练合成数据

摘要

文本属性图(TAG)广泛应用于许多现实世界领域,学习标签需要对文本语义和图结构进行联合建模。 TAG 建模的标准方法是将语言模型 (LM) 和图神经网络 (GNN) 结合起来,但联合训练的计算成本很高且难以扩展。数据集 蒸馏 是降低训练成本的一种有前途的方法,但现有方法不太适合 TAG,因为它们通常是为单一模态设计的,或者在 蒸馏 期间仍然需要在完整数据集上重复训练昂贵的 LM-GNN 模型。为了解决这个问题,我们提出了 TaLK,一种有效的 TAG 数据集 蒸馏 方法,它将 LM 与图感知神经正切内核结合起来。这种设计实现了高效的数据集 蒸馏,避免了对完整数据集的重复联合训练,同时反映了有效 TAG 学习的文本和结构信息。多个 TAG 基准测试的实验表明,TaLK 始终优于现有基准,仅用 1% 的合成数据即可实现高达 97% 的全数据集性能。