论文
DR$^{3}$-Eval:迈向真实且可复现的深度研究评估
DR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research Evaluation
摘要
深度研究智能体(Deep Research Agents, DRAs)旨在解决涉及规划、检索、多模态理解和报告生成的复杂长时程研究任务,但由于动态的网页环境和模糊的任务定义,其评估仍然充满挑战。我们提出DR$^{3}$-Eval,一个用于评估深度研究智能体在多模态、多文件报告生成上能力的真实且可复现基准。DR$^{3}$-Eval由真实的用户提供材料构建,并为每个任务配备静态研究沙箱语料库,后者在保持完全可验证的同时模拟开放网络的复杂性,包含支持性文档、干扰项和噪声。此外,我们引入一个多维评估框架,度量信息召回(Information Recall)、事实准确性(Factual Accuracy)、引用覆盖率(Citation Coverage)、指令遵循(Instruction Following)和深度质量(Depth Quality),并验证了其与人类判断的一致性。基于多个最先进语言模型开发的DR$^{3}$-Agent多智能体系统的实验表明,DR$^{3}$-Eval极具挑战性,并揭示了检索稳健性和幻觉控制方面的关键失败模式。我们的代码与数据已公开。
