论文

DREAM:基于Agentic指标的深度研究评估

DREAM: Deep Research Evaluation with Agentic Metrics

模型评测评测方法与指标

摘要

深度研究智能体(Deep Research Agents)能生成分析师级报告,但因缺乏单一标准答案且研究质量多维,评估依然困难。近期基准提出各自方法,却受“综合幻象”(Mirage of Synthesis)困扰:表面流畅与引文对齐俱佳,仍可能掩盖事实与推理缺陷。我们以跨四个垂直维度的分类法刻画这一缺口,揭示关键能力错配:静态评估器天然缺乏评估时间有效性与事实正确性所需的工具使用能力。为此我们提出DREAM(Deep Research Evaluation with Agentic Metrics),让评估本身Agentic化,落实“能力对等”原则。DREAM通过一套评估协议组织测评,将查询无关指标与由工具调用智能体生成的自适应指标结合,实现时间感知的覆盖、有据核验与系统性推理探查。受控评估表明,DREAM对事实性与时效衰减的敏感度显著高于现有基准,提供了可扩展、免参考的评估范式。

DREAM:基于Agentic指标的深度研究评估
图2:DREAM概览。我们的框架分两个阶段运行。左:协议创建(Protocol Creation),将与查询无关的静态指标(Static Metrics)同自适应指标(Adaptive Metrics)相结合,后者由配备网页搜索工具和可选外部数据访问工具的智能体构建。右:协议执行(Protocol Execution),每个指标被路由到合适的评估器,可以是LLM、可使用工具的智能体或工作流。