论文

从简单问答到深度研究:通过迭代任务演化构建可验证基准

From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution

模型评测基准与评测资源

摘要

深度研究基准要求专家级任务和可靠的评估,这些评估基于任务特定的知识。现有的基准依赖于专家编写或预存在的人类编写材料,而完全自动构建则难以确保一致性和可追溯的验证。为解决这一差距,我们引入了一个涵盖31个主题和10个大类的500个深度研究任务的可验证基准,设计了三种查询形式来探查深度研究所需的互补能力。基准通过迭代的探索者-形式化者-挑战者管道自动构建,逐步将简单问题转化为深度研究任务。每个任务都被表示为一个有向无环图(DAG),包含原子步骤及其关联的检查点,使查询、DAG和评分点能够在可控的环境中进化。实验表明,基准清晰地区分了模型和查询类型,其基于事实的点对点评分点能够进行精细的、与人类对齐的、稳定且可追溯的评估。我们的数据、实现和结果是公开的。

从简单问答到深度研究:通过迭代任务演化构建可验证基准:论文配图
图1 :第1轮将简单查询q1q_{1} 转化为需要再多一步才能解决的问题。第2轮进一步演变为具有多个答案方面的查询。通过进一步四舍五入到Round TT ,该过程产生了更困难的深度研究任务qTq_{T} ,需要多源搜索和综合分析。