论文

GraphInfer-Bench:对LLM的图推理能力进行基准测试

GraphInfer-Bench: Benchmarking LLM's Inference Capability on Graphs

模型评测基准与评测资源

摘要

图分析是许多应用程序的基础,这些应用程序的答案无法在单个记录中查找或沿路径检索:洗钱团伙、药物重新利用、用户偏好和科学主题都是从节点及其邻居推断出来的。我们引入 GraphInfer-Bench,这是 LLM 是否可以执行此图推理的基准:生成没有单个节点支持且没有路径检索的开放式答案。现有的图 QA 协议无法测试这一能力:算法模拟、节点分类、单节点描述、KG-QA 和 GraphRAG 都承认可从一个节点或沿一条路径检索答案。 GraphInfer-Bench 沿着描述(区域是什么)和比较(区域有何不同)定义了五个任务,每个任务的构建都是为了使 真值 不存在于单个节点中。该版本包含 6 个真实世界图表中的 42,000 个样本,这些样本是自动生成的,并通过四层质量控制协议进行筛选。我们针对相同的任务评估了四种方法族:图标记对齐模型、零样本前沿闭源 LLM、Graph2Text 监督的 微调 以及作为结构参考的普通 GNN。没有任何方法系列可以弥补这一差距。图标记对齐部分处理描述任务(关系、主题),但在比较任务上崩溃。 Frontier LLM 在基于 LLM 的方法中领先于异常值检测和社区划分,但在屏蔽节点预测方面落后。 Graph2Text SFT 是描述方面最强的基于 LLM 的方法,但在比较中落后于前沿 LLM。在每项任务中,普通 GNN 都匹配或击败最强的基于 LLM 的行,在社区检测方面具有最大的优势。 GraphInfer-Bench 将图推理视为一种开放的能力差距,而不是任何一种架构的属性。