论文

在专家咨询工作上评估深度研究智能体:带验证器、评分细则与认知陷阱的基准

Evaluating Deep Research Agents on Expert Consulting Work: A Benchmark with Verifiers, Rubrics, and Cognitive Traps

智能体系统Agent任务评测长程任务评测

摘要

前沿深度研究代理 (DRA) 规划研究任务、综合文档并按需返回结构化交付成果。它们在企业工作流程中的部署速度比评估速度还要快。现有基准衡量事实回忆、单跳 QA 或通用代理技能,缺少部署 DRA 来生成的多文档、决策级工作。我们引入了一个针对管理顾问典型一周的结构化分析交付成果的基准。我们根据 42 个 SME 编写的提示对三个前沿代理进行了评分,即带有网络搜索的 Claude Opus 4.6、OpenAI o3-deep-research 和 Google Gemini 3.1 Pro 深度研究。 126 个响应中的每一个都在两层上进行评分:确定性的真实验证者(每个任务平均 13.8)和五标准 0-3 SME 评分标准,组成 0-100 的验证者评分评分表 (VRS)。大多数提示都嵌入了认知陷阱,这些陷阱会惩罚表面模式匹配。在我们的联合阈值(评分标准平均值 >= 2.5 且验证者率 >= 80%)下的接受度普遍较低:Gemini 21.4%、o3 9.5%、Claude 9.5%。 VRS 平均分数与已发布的基于评分标准的基准一致(我们的最高 62.6 与 APEX-v1 64.2、ProfBench 65.9、ResearchRubrics < 68%),验证了评分标准的构造。对于专用 DR 代理,接受率低于 APEX-Agents 的 MC 段 Pass@1 等级 (12.3-22.7%);尽管通过更严格的联合分级和陷阱设计打开了安全带优势,但我们的地板还是低了三个点。每个代理的失败都有所不同。克劳德 (Claude) 交付的成果最可靠(在需要文件的任务上,其速度是其他人的 4.5 倍),但具有最高的制造签名。 o3 具有最清晰的推理平均值,但会删除所需的部分并传播算术错误。双子座是双峰的,接受率最高,同时也是零分红字单元最多的。