论文
将 BrowseComp-Plus 投影到 ClimbMix 上:为代理搜索提供更现实的语料库
Projecting BrowseComp-Plus onto ClimbMix: Toward More Realistic Corpora for Agentic Search
摘要
BrowseComp-Plus 基准测试通过用固定语料库替换不透明的网络搜索来理清代理搜索的评估,以便代理的角色可以与 检索器 的角色分开。然而,该语料库仅包含大约 100K 文档,并且是根据基准测试自身查询的支持文档加上挖掘的硬否定进行组装的,因此证据和干扰项都是根据查询选择的。我们引入了 $\text{BrowseComp-Plus}_{\text{CM}}$,它保留了 BrowseComp-Plus 问题,但将其证据重新定位到 ClimbMix,ClimbMix 是 NVIDIA 为 预训练 语言模型发布的 400B 词元、553M 文档的网络文本混合体,并且在不参考任何基准的情况下构建。我们的主要贡献是使这成为可能的投影管道:它将每个问题分解为原子推理跳跃,并将每个跳跃都基于新语料库中,仅当自动验证、独立代理和人工审查都确认每个跳跃都受到支持时才保留问题。该管道与数据集无关,适用于任何将问题分解为可验证事实的基准。应用于 830 个 BrowseComp-Plus 测试问题,我们的管道产生了 57 个证据完整对应的问题,并具有问题级相关性判断。投影将难度转移到检索上,因为我们评估的最强代理失去了 5 个点的答案准确性,但其证据召回率从 84.3% 下降到 21.4%,同时发出的搜索调用增加了 63%。作为一系列预测中的第一个,我们在 https://github.com/castorini/cmass 上发布了管道、基准测试和分析。