论文
GNN-CB:人类和LLM评估的图神经网络竞赛基准
GNN-CB: A Graph Neural Network Competition Benchmark for Human and LLM Evaluation
摘要
大语言模型(LLM)在编码和推理基准测试中表现出了强大的性能;然而,它们解决图结构机器学习问题的能力在很大程度上仍未得到探索。特别是,目前还没有基准评估LLM是否可以在现实竞赛设置下自主解决端到端图神经网络(GNN)编码任务。为了解决这一差距,本文引入了 GNN-CB,这是第一个基于竞争的基准,用于在 GNN 编码任务上评估人类和LLM。 GNN-CB 由 18 个精心策划的竞赛组成,涵盖不同图类别、领域和难度级别的节点、边缘和图级预测。所有提交的内容都通过具有隐藏测试集和标准化评分的统一自动化管道进行评估。人类参与者在受控竞争约束下解决任务,而LLM使用基于具有有限执行和修复循环的计划然后编码范例的冻结零样本提示协议进行评估。该基准测试还支持同一协议中的非智能体和基于智能体的自主评估。根据我们的评估方案,LLM很少能与人类顶级表现相媲美,并且在比赛中表现不太稳定。没有单一模型占据主导地位:LLM赢得了一些比赛,但人类在大多数任务上仍然保持着最高分。我们发布 GNN-CB 作为一个实时基准,具有自动化评估基础设施、动态排行榜和可重复的执行管道。除了基准测试之外,GNN-CB 还提供了面向实践的资源,用于研究 GNN 在逐渐多样化的图学习任务中的实现。基准和评估框架可在 https://basiralab.github.io/GNN-CB/. 上公开获取
