论文
超越语义相似性:重新思考通过直接语料库交互进行代理搜索的检索
Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction
摘要
现代检索系统,无论是词汇检索还是语义检索,都通过固定的相似性接口公开语料库,该接口在推理之前将访问压缩为单个 top-k 检索步骤。这种抽象是有效的,但对于代理搜索来说,它成为一个瓶颈:精确的词汇约束、稀疏线索连词、局部上下文检查和多步假设细化很难通过调用传统的现成 检索器 来实现,而且早期过滤掉的证据无法通过更强的下游推理来恢复。代理任务进一步加剧了这种限制,因为它们需要代理协调多个步骤,包括发现中间实体、组合薄弱线索以及在观察部分证据后修改计划。为了解决这个限制,我们研究了直接语料库交互(DCI),其中代理使用通用终端工具(例如 grep、文件读取、shell 命令、轻量级脚本)直接搜索原始语料库,而不需要任何嵌入模型、向量索引或检索 API。这种方法不需要离线索引,并且自然地适应不断发展的本地语料库。在 IR 基准测试和端到端代理搜索任务中,这种简单的设置在多个 BRIGHT 和 BEIR 数据集上明显优于强稀疏、密集和重排序基线,并且在 BrowseComp-Plus 和多跳 QA 上获得了很高的准确性,而无需依赖任何传统语义 检索器。我们的结果表明,随着语言代理变得更强,检索质量不仅取决于推理能力,还取决于模型与语料库交互的界面的分辨率,DCI 为代理搜索开辟了更广阔的界面设计空间。