论文

DeepWeb-Bench:要求海量跨源证据与长程推导的深度研究基准

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation

智能体系统Agent任务评测长程任务评测

摘要

深度研究指智能体搜索开放网络、收集证据并通过长程推理推导出答案,是前沿语言模型的重要应用场景。前沿深度研究产品在现有基准上得分很高,仅凭当前评估数据难以区分其能力。我们提出 DeepWeb-Bench,一个对当前前沿模型而言显著难于现有基准的深度研究基准。难度来自数据本身的三个特性:每个任务都要求海量证据收集、跨源核对以及长程多步推导。我们将这三个难度来源映射为四大能力族(检索、推导、推理与校准),并按能力族报告结果。每个参考答案都附带一个包含四级披露程度与可用跨源核验的来源溯源记录,使分数更容易对照底层证据进行审计。我们在九个前沿模型上评估 DeepWeb-Bench 并报告三项发现:(1)检索不是瓶颈——检索失败仅占错误的 12-14%,而推导与校准失败占比超过 70%;(2)强弱模型以质性不同的方式失败——强模型的错误以推导不完整为主,弱模型则以幻觉式的精确为主;(3)模型在领域间表现出真正的专业化——跨模型一致性仅 rho = 0.61,单案例分歧最高达 18.8 个百分点。公开发布的基准包含数据、评分量规与评估代码。

DeepWeb-Bench:要求海量跨源证据与长程推导的深度研究基准:论文配图
图 3:100 项任务的细粒度分数变化。 (a) 模型任务级别得分之间的成对斯皮尔曼等级相关性;平均相关性为 ρ=0.61\rho=0.61,表明模型不会在完全相同的任务上失败。为了节省空间,模型标签仅在图中进行缩写。 (b) 每个模型的任务级分数分布,其中每个箱线图总结了该模型的 100 个每个任务分数。