论文
从简单问答到深度研究:通过迭代任务演化构建可验证基准
From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution
摘要
深度研究基准要求专家级任务和可靠的评估,这些评估基于任务特定的知识。现有的基准依赖于专家编写或预存在的人类编写材料,而完全自动构建则难以确保一致性和可追溯的验证。为解决这一差距,我们引入了一个涵盖31个主题和10个大类的500个深度研究任务的可验证基准,设计了三种查询形式来探查深度研究所需的互补能力。基准通过迭代的探索者-形式化者-挑战者管道自动构建,逐步将简单问题转化为深度研究任务。每个任务都被表示为一个有向无环图(DAG),包含原子步骤及其关联的检查点,使查询、DAG和评分点能够在可控的环境中进化。实验表明,基准清晰地区分了模型和查询类型,其基于事实的点对点评分点能够进行精细的、与人类对齐的、稳定且可追溯的评估。我们的数据、实现和结果是公开的。
