论文

GABench:LLM Agent图分析任务的综合基准

GABench: A Comprehensive Benchmark for Evaluating LLM Agents on Graph Analysis Tasks

智能体系统Agent任务评测

摘要

大语言模型(LLM)代理正变得越来越有能力进行规划、使用工具和与外部环境互动。它们通常由Harnesses支持,这些Harnesses管理状态并协调多步执行。图分析为评估其代理能力提供了一个有前景的设置,因为图代理需要访问数据并执行操作在图环境中。然而,现有的LLM图基准任务和图类型覆盖有限,使得难以全面评估LLM代理。此外,它们通常将图分析作为文本式问题回答,其中图信息直接在提示中提供,限制了对端到端代理能力的评估。为解决这些问题,我们引入了GABench,这是一个全面的图代理评估基准。GABench涵盖了三种图类型,并覆盖了四个图分析任务类别:图检索、图理论、图机器学习和图开放式问题回答。GABench还提供了84个可执行工具,用于访问图数据并执行多样化的图操作。基于这些工具,我们开发了一个图代理分析任务生成管道,并构建了10,400个任务,这些任务具有可验证的基准。使用GABench,我们评估了多种前沿的LLM和代理Harness。我们的实验揭示了三个关键发现:(1)现有的LLM代理仍然难以处理复杂的图分析任务。(2)代理选择显著影响性能,但现有的Harness仍然在处理复杂的图任务方面受限。(3)图分析更多依赖于工具调用的质量而非数量。我们的发现为LLM代理在图分析中的开发和评估提供了实用的见解。

GABench:LLM Agent图分析任务的综合基准:论文配图
图 1. GABench 概述。该基准评估了四个代理图分析类别的 LLM 代理:图检索、图理论、图机器学习和图开放式问答。 GABench 还提供了涵盖所有任务类别的可执行图形分析工具集。我们展示了每个类别的代理任务的具体示例。