桥接证据:静态检索实用程序不能预测多步代理搜索中的因果实用程序
Bridge Evidence: Static Retrieval Utility Does Not Predict Causal Utility in Multi-Step Agentic Search
摘要
检索系统根据静态有用性概念进行训练和评估:将文档和问题交给读者模型,查看答案是否有所改进,并对文档进行相应评分。当单独阅读文档时,这个想法是成立的。当语言模型充当搜索代理、发出多个查询并轮流进行推理时,它就会崩溃,因为文档的重要性在于它让代理下一步做什么,而不是它对当前问题所说的内容。我们衡量这一差距而不是争论它。在 HotpotQA 上使用 ReAct 风格的代理,我们重播 1000 个开发问题,并且对于代理读取的每个文档,将其删除并从该点重新运行其余的轨迹。将原始运行与其反事实进行比较,得出来自三个增量的反事实轨迹效用 (CTU) 分数:最终答案质量、下一个查询检索质量和回合计数。将 CTU 与静态 RAG 实用程序 (SRU) 交叉比较超过 23,322 个文档观察结果,两者在统计上接近独立 (Spearman rho = -0.026)。代理阅读的文档中大约有三分之一是因果负载的,而对于静态读者来说看起来毫无用处;我们称这些为过渡文件。当基于读取器的轴更换为 BM25 和交叉编码器代理时,该模式仍然存在,在均匀分布的轴上提供 27.2% 的桥接单元。第二个实验确定了该机制。使用先前工作中的可观察实体相关性 (OER) 度量,区分相关候选者和不相关候选者的实体在代理的下一个查询中出现的频率是仅在非相关文档中找到的实体的 4.02 倍(6.1% vs 1.5%,n = 227,139)。桥接文档通过向代理提供一个重定向搜索的区别性实体来获得收益。静态相关性和因果有用性在代理检索中是不同的量,优化第一个并不能带来第二个。