论文
DRBENCHER:你的智能体能识别实体、检索其属性并完成计算吗?
DRBENCHER: Can Your Agent Identify the Entity, Retrieve Its Properties and Do the Math?
摘要
深度研究代理越来越多地将网络浏览与多步骤计算交织在一起,但现有的基准测试是孤立地评估这些功能的,从而在评估实际性能时造成了盲点。我们引入了 DRBENCHER,这是一个针对需要浏览和计算的问题的综合基准生成器。它强制执行四个标准:可验证性(通过对知识图值执行参数化代码来计算黄金答案)、复杂性(多跳实体识别、属性检索和特定于域的计算)、难度(两阶段验证级联过滤掉生成模型可解决的问题)和多样性(贪婪的最大最小嵌入过滤器最大化覆盖范围)。这些标准是通过跨越五个领域的统一答案优先管道来实现的:生物化学、金融、地球物理、安全和历史。人类评估显示 76% 的有效性(84% 不包括陈旧数据),其中 35% 的错误是由于过时的知识图条目造成的,这凸显了系统对不断变化的数据进行推理的固有局限性。自动评估表明,最强的前沿模型仅达到 20% 的答案准确率。与手动构建的基准(BrowseComp+、MATH-500、GPQA)相比,DRBENCHER 实现了最高的语义多样性。