论文
代理图词元推理
Agentic Graph Token Reasoning
摘要
图对整个科学和工业领域的关系数据进行建模,从引文网络到产品共同购买图。由于许多此类图的节点都带有富文本,因此越来越多的工作将 大语言模型 (LLM) 应用于图分析。这些方法中最图本机的方法使用图标记:图编码器将图视图(例如节点、其 k 跳邻域或集群)压缩为短的连续标记块,这些连续标记联合编码节点属性和拓扑,并由模型直接读取。然而,现有方法以静态单次方式使用图标记:它们在模型看到目标之前对一个预定义的图视图进行编码,并且从不修改它,从而使模型的逐步推理能力未被使用。我们引入了代理图标记推理,它将图标记化重新定义为推理过程本身的一部分。在每一步中,模型都会选择要编码的图形视图以及粒度;根据需要调用图编码器来具体化相应的图标记;并将生成的块拼接到运行上下文中。因此,该模型在图标记空间中逐步推理,并且它读取的标记是与轨迹相关的。我们通过三阶段训练管道实现这一点:(i)自监督任务,教模型读取异构图标记,(ii)具有图标记一致性正则化器的标记鲁棒轨迹阶段,以及(iii)奖励图标记证据和节点文本证据一致的轨迹的偏好优化。在跨越七个图域的评估中,我们的模型大幅优于一系列广泛的基线,并将零样本转移到看不见的域,而无需任何每个目标 微调。更广泛地说,这项工作将基于 LLM 的图分析从静态图词元编码器推向图原生代理范例。