论文
DREAM:基于Agentic指标的深度研究评估
DREAM: Deep Research Evaluation with Agentic Metrics
摘要
深度研究智能体(Deep Research Agents)能生成分析师级报告,但因缺乏单一标准答案且研究质量多维,评估依然困难。近期基准提出各自方法,却受“综合幻象”(Mirage of Synthesis)困扰:表面流畅与引文对齐俱佳,仍可能掩盖事实与推理缺陷。我们以跨四个垂直维度的分类法刻画这一缺口,揭示关键能力错配:静态评估器天然缺乏评估时间有效性与事实正确性所需的工具使用能力。为此我们提出DREAM(Deep Research Evaluation with Agentic Metrics),让评估本身Agentic化,落实“能力对等”原则。DREAM通过一套评估协议组织测评,将查询无关指标与由工具调用智能体生成的自适应指标结合,实现时间感知的覆盖、有据核验与系统性推理探查。受控评估表明,DREAM对事实性与时效衰减的敏感度显著高于现有基准,提供了可扩展、免参考的评估范式。
