论文
WANDR:广泛和深入研究的基准
WANDR: A Benchmark for Wide and Deep Research
摘要
WANDR(Wide AND Deep Research)是针对研究代理的 500 项现实且具有挑战性的数据收集任务的基准。每个任务都需要一个系统来发现满足指定标准(广度)的大量实体,通过多个协调的网络搜索(深度)调查每个实体,并返回带有支持源和摘录的独立可验证记录。任务表示为资格关键层次结构,指定每个级别的实体、关系、证据和所需数量;包含 n 个公司、每个公司有 m 个员工、每个员工有 k 个来源的层次结构需要 n x m x k 条记录。这种结构支持多种工作流程,例如市场测绘、尽职调查、文献综述、产品比较和人才采购,目标范围从数十到数千条记录。 WANDR 用特定于任务的判断器取代了静态的标准答案集,这些判断器重新获取引用的页面并根据其证据验证每条记录,从而可以评估当前和不断变化的事实。记录判决被汇总为软、硬精度、召回率和 F1 分数,以区分事实质量、覆盖范围和层次完整性。这些任务源自去识别化的产品使用日志,并通过半自动化管道生成,并在需要时进行自动检查、实证审计和人工审查。我们评估了六个生产研究系统,发现基准远未饱和:在高度努力下,最强的系统仅达到 0.363 软 F1 和 0.133 硬 F1。随着目标量和层次结构深度的增加,性能会下降,不完整的发现、缺失的丰富和不完整的证据构建仍然是主要瓶颈。基准测试和评估工具可在 https://github.com/perplexityai/wandr 上获取。