论文

LENS:通过动态原始文档的潜在证据探索进行上下文搜索

LENS: In-Context Search via Latent Evidence Exploration over Dynamic Raw Documents

上下文与知识检索增强

摘要

LLM 代理越来越多地回答有关动态原始文档集合的问题,其中文件在预处理之前可能会发生变化,并且相关证据(跨度、部分、页面或表格)依赖于查询。现有的检索增强方法通过固定分块、嵌入或持久索引来预先物化证据:对于查找有效,但成本高昂、容易过时,并且在查询已知之前就致力于粒度。我们将上下文搜索制定为动态原始文档引起的潜在证据空间上的预算证据本地化,并提出 LENS(潜在证据探索和搜索),这是一种无索引框架。 LENS 不是预先物化证据空间,而是对候选单元保持查询条件信念,通过互补的词汇、本地和探索性提案策略迭代地选择候选单元,通过 LLM 相关性预言机更新信念,并在可控预算下缩小到高后部区域。证据被整合到紧凑的、以源为基础的感兴趣区域中,并压缩成在相关查询中重复使用的自组织知识集群。在使用匹配的语料库快照进行的受控 500 个问题评估中,LENS 达到了 62.4% 的精确匹配和 84.8% 的证据召回率,而 ReAct 式基线的精确匹配率为 65.2%,但证据召回率为 50.4%。在各个尺度上,LENS 提供了最强有力的支持事实定位和答案基础。在零索引的原始维基百科转储上的固定 150 个问题 fullwiki 子集上,LENS 和 ReAct 在官方答案质量上几乎持平(43.3% vs. 42.7% EM),而 LENS 在检索到的证据中提供了更多答案(84.0% vs. 70.7%)。无检索的闭卷参考强调了模型内存的贡献。 LENS 在语料库更改后可进行查询,无需预处理或持久索引,并始终保留基于源的证据本地化。