论文

AISE-Bench:学术知识图谱信息获取的全周期精选基准

AISE-Bench: A Full-Cycle Curated Benchmark for Information Seeking on Academic Knowledge Graphs

智能体系统Agent任务评测长程任务评测

摘要

以工具增强的大语言模型(LLM)正成为能使用网络引擎、API与代码解决复杂长程任务的自主智能体。当前面向学术图谱信息获取的工具使用基准依赖合成模板、简化的解空间或狭窄任务(如以论文为中心的任务),留下关键挑战未被探索:真实的用户意图、复杂的多步API规划、丰富的API参数填充、带引用的落地答案、以及对过程与结果的全面评估。我们提出AISE-Bench,一个真实世界、全周期标注的学术知识图谱信息获取基准:发布含1,133个问答对,包括查询分类、完整API执行轨迹、经验证的参数与带引用链接的落地答案。为支持高质量标注,我们设计了定制的智能体工作流,使标注者能高效规划、执行与修订复杂API工作流。我们开发了测量答案质量、引用落地、API规划正确性与执行成功的综合评估协议。在14个受评方法中,即使最强模型(PLAY2PROMPT+Gemini-3-Pro)也只取得中等表现,常在API规划与执行上挣扎。AISE-Bench为定量评估与改进多步API使用型LLM智能体的逐步正确性、落地摘要与可追溯推理确立了有挑战性的新试验台。代码与数据见https://aise-bench.github.io/。

AISE-Bench:学术知识图谱信息获取的全周期精选基准:论文配图
图 1.AISE-Bench 构建流程。我们首先根据 AMiner 的真实用户查询进行过滤和采样。然后,使用定制代理工作流程 (CAW),我们为每个查询生成初始 API 计划和答案。注释者完善基于 CAW 的计划和答案,并且每个带注释的查询均由至少一名审阅者验证。