论文
DeepWeb-Bench:要求海量跨源证据与长程推导的深度研究基准
DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation
摘要
深度研究指智能体搜索开放网络、收集证据并通过长程推理推导出答案,是前沿语言模型的重要应用场景。前沿深度研究产品在现有基准上得分很高,仅凭当前评估数据难以区分其能力。我们提出 DeepWeb-Bench,一个对当前前沿模型而言显著难于现有基准的深度研究基准。难度来自数据本身的三个特性:每个任务都要求海量证据收集、跨源核对以及长程多步推导。我们将这三个难度来源映射为四大能力族(检索、推导、推理与校准),并按能力族报告结果。每个参考答案都附带一个包含四级披露程度与可用跨源核验的来源溯源记录,使分数更容易对照底层证据进行审计。我们在九个前沿模型上评估 DeepWeb-Bench 并报告三项发现:(1)检索不是瓶颈——检索失败仅占错误的 12-14%,而推导与校准失败占比超过 70%;(2)强弱模型以质性不同的方式失败——强模型的错误以推导不完整为主,弱模型则以幻觉式的精确为主;(3)模型在领域间表现出真正的专业化——跨模型一致性仅 rho = 0.61,单案例分歧最高达 18.8 个百分点。公开发布的基准包含数据、评分量规与评估代码。
