论文
DailyReport:评估搜索智能体日常搜索任务的开放式基准
DailyReport: An Open-ended Benchmark for Evaluating Search Agents on Daily Search Tasks
摘要
搜索代理 (SA) 通常利用大型语言模型 (LLM) 通过自主探索网络资源并将信息合成为综合响应来支持复杂的信息查找任务。对于 SA 评估,先前的基准测试主要关注现实世界用户场景中不太可能出现的专门任务。此外,他们对粗略任务级标准的依赖往往限制了评估的可解释性。为了弥补这一差距,我们引入了 DailyReport,这是一个开放式基准,用于评估 SA 在日常搜索任务上的能力。它包含 150 个开放式任务和 3,546 个相关的量规,捕获现实世界用户广泛讨论的及时信息需求。每个任务都被分解为子任务,并通过跨维度的级联评估标准进行评估。通过级联性能归因和以用户为中心的聚合,我们得出每个维度的高度可解释的分数以及用户偏好分数。我们对 17 个代理系统的结果表明,当前系统仍然达不到用户的期望。为了方便未来的研究,我们的数据集和代码在 https://github.com/AGI-Eval-Official/DailyReport 上公开提供。
