论文
AISE-Bench:学术知识图谱信息获取的全周期精选基准
AISE-Bench: A Full-Cycle Curated Benchmark for Information Seeking on Academic Knowledge Graphs
摘要
以工具增强的大语言模型(LLM)正成为能使用网络引擎、API与代码解决复杂长程任务的自主智能体。当前面向学术图谱信息获取的工具使用基准依赖合成模板、简化的解空间或狭窄任务(如以论文为中心的任务),留下关键挑战未被探索:真实的用户意图、复杂的多步API规划、丰富的API参数填充、带引用的落地答案、以及对过程与结果的全面评估。我们提出AISE-Bench,一个真实世界、全周期标注的学术知识图谱信息获取基准:发布含1,133个问答对,包括查询分类、完整API执行轨迹、经验证的参数与带引用链接的落地答案。为支持高质量标注,我们设计了定制的智能体工作流,使标注者能高效规划、执行与修订复杂API工作流。我们开发了测量答案质量、引用落地、API规划正确性与执行成功的综合评估协议。在14个受评方法中,即使最强模型(PLAY2PROMPT+Gemini-3-Pro)也只取得中等表现,常在API规划与执行上挣扎。AISE-Bench为定量评估与改进多步API使用型LLM智能体的逐步正确性、落地摘要与可追溯推理确立了有挑战性的新试验台。代码与数据见https://aise-bench.github.io/。
