论文
ScholarGym:学术文献检索深度研究工作流程的基准测试
ScholarGym: Benchmarking Deep Research Workflows on Academic Literature Retrieval
摘要
工具增强的大语言模型已经从单轮问答发展到深度研究工作流程,迭代地规划查询、调用外部工具并合成信息来满足复杂的信息需求。评估此类工作流程提出了一项根本挑战:对实时 API 的依赖引入了不确定性,因为由于时间漂移、速率限制和不断变化的后端状态,工具调用可能会在运行中产生不同的结果。这种差异破坏了可重复性并使跨系统比较无效。我们推出了 ScholarGym,这是一个模拟环境,用于对学术文献的深度研究工作流程进行可重复的评估。该环境将工作流组件解耦为查询规划、工具调用和相关性评估,从而能够在受控条件下对每个阶段进行细粒度分析。 ScholarGym 基于 57 万篇论文的静态语料库构建,具有确定性检索功能,提供 2,536 个查询以及专家注释的基本事实。跨不同骨干模型的实验揭示了推理能力、规划策略和选择机制如何在迭代细化中相互作用。
