论文

通过随机游走评估 LLM 的大规模图属性估计

Evaluating LLMs on Large-Scale Graph Property Estimation via Random Walks

模型评测基准与评测资源

摘要

随着大语言模型(LLM)推理能力的迅速提高,在各种领域中使用它们的需求也不断增加。这就需要通过各种测试和基准来仔细评估这些模型的能力极限。图结构在现实数据中无处不在,通常用于表示和分析数据内的关系模式。图文献中已经提出了许多基准来测试 LLM 遵循和执行图算法的推理能力。然而,由于 LLM 的上下文长度有限,这些基准测试由非常小的图组成。在现实世界的数据中,图表的大小可能要大得多,而且在许多情况下,无法完全访问。在本文中,我们研究了由于可访问性有限的非常大的图而出现的一类问题。我们提出了一个大型图基准数据集 EstGraph,并引入了四个旨在估计大型图属性的不同任务。我们使用各种图形数据集评估 LLM 在这些任务上的推理能力。此外,我们还提供基于大型图(最多数百万个节点)的随机游走采样的特定于任务的提示构造,可在上下文长度的限制内有效地将足够的信息传达给 LLM。