论文

DR$^{3}$-Eval:迈向真实且可复现的深度研究评估

DR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research Evaluation

智能体系统Agent任务评测长程任务评测

摘要

深度研究智能体(Deep Research Agents, DRAs)旨在解决涉及规划、检索、多模态理解和报告生成的复杂长时程研究任务,但由于动态的网页环境和模糊的任务定义,其评估仍然充满挑战。我们提出DR$^{3}$-Eval,一个用于评估深度研究智能体在多模态、多文件报告生成上能力的真实且可复现基准。DR$^{3}$-Eval由真实的用户提供材料构建,并为每个任务配备静态研究沙箱语料库,后者在保持完全可验证的同时模拟开放网络的复杂性,包含支持性文档、干扰项和噪声。此外,我们引入一个多维评估框架,度量信息召回(Information Recall)、事实准确性(Factual Accuracy)、引用覆盖率(Citation Coverage)、指令遵循(Instruction Following)和深度质量(Depth Quality),并验证了其与人类判断的一致性。基于多个最先进语言模型开发的DR$^{3}$-Agent多智能体系统的实验表明,DR$^{3}$-Eval极具挑战性,并揭示了检索稳健性和幻觉控制方面的关键失败模式。我们的代码与数据已公开。

DR$^{3}$-Eval:迈向真实且可复现的深度研究评估:论文配图
图 2:DR3-Eval 框架概述。 (1)数据构建通过发散收敛机制综合来自现实世界多模态文件的搜索路径,建立具有受控信噪比和向后导出查询的静态沙箱。 (2)我们的DR3-Agent采用分层多代理架构,其中感知增强的主代理协调全局推理,而专门的子代理执行迭代沙箱检索和文件解析。 (3) 评估协议利用多维度量套件来综合评估证据获取和分析报告生成的性能。