论文
DeepResearch-9K:一个具有挑战性的Deep Research智能体基准数据集
DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent
摘要
Deep Research智能体能够执行多步网络探索、定向检索和复杂问答。尽管能力强大,Deep Research智能体面临两个关键瓶颈:(1)缺乏具有真实难度的大规模、有挑战性的数据集;(2)缺乏可获取的开源数据合成与智能体训练框架。为弥合这些空白,我们首先构建DeepResearch-9K,一个专为Deep Research场景设计、基于开源多跳问答(QA)数据集经低成本自主流水线构建的大规模挑战性数据集。值得注意的是,它包含(1)从L1到L3三个难度级别的9,000个问题;(2)来自最先进Deep Research智能体Tongyi-DeepResearch-30B-A3B的带推理链的高质量搜索轨迹;(3)可验证的答案。此外,我们开发开源训练框架DeepResearch-R1,支持(1)多轮网络交互、(2)不同强化学习(RL)方法,以及(3)基于规则的结果奖励和LLM-as-judge反馈等不同奖励模型。最后,实证结果表明,在我们的DeepResearch-R1下于DeepResearch-9K上训练的智能体在具有挑战性的Deep Research基准上取得最先进结果。我们在 https://huggingface.co/datasets/artillerywu/DeepResearch-9K 发布DeepResearch-9K数据集,在 https://github.com/Applied-Machine-Learning-Lab/DeepResearch-R1 发布DeepResearch-R1代码。