论文

ScholarGym:学术文献检索深度研究工作流程的基准测试

ScholarGym: Benchmarking Deep Research Workflows on Academic Literature Retrieval

模型评测基准与评测资源

摘要

工具增强的大语言模型已经从单轮问答发展到深度研究工作流程,迭代地规划查询、调用外部工具并合成信息来满足复杂的信息需求。评估此类工作流程提出了一项根本挑战:对实时 API 的依赖引入了不确定性,因为由于时间漂移、速率限制和不断变化的后端状态,工具调用可能会在运行中产生不同的结果。这种差异破坏了可重复性并使跨系统比较无效。我们推出了 ScholarGym,这是一个模拟环境,用于对学术文献的深度研究工作流程进行可重复的评估。该环境将工作流组件解耦为查询规划、工具调用和相关性评估,从而能够在受控条件下对每个阶段进行细粒度分析。 ScholarGym 基于 57 万篇论文的静态语料库构建,具有确定性检索功能,提供 2,536 个查询以及专家注释的基本事实。跨不同骨干模型的实验揭示了推理能力、规划策略和选择机制如何在迭代细化中相互作用。

ScholarGym:在深度研究的信息收集阶段评测大语言模型能力
图1:ScholarGym 概览。每次迭代包含由有向信息流连接的三个阶段:红色实线箭头表示阶段输入,橙色虚线箭头表示输出。Query Planning 接收来自上一次迭代的子查询树 ℳ_{t-1}、经验缓冲 ℬ_{t-1} 与反馈 𝒪_{t-1},然后输出新生成的子节点与更新后的经验缓冲。所得子查询被传递给 Tool Invocation,其对检索调用进行参数化并针对语料库执行;检索到的候选先经过基于相关性的排序再进行选择。Relevance Assessment 评估排序后的论文并产生反馈,用于指导下一次迭代。