论文

直接语料交互中的证据盲区:用AtlasNav实现持久化导航

Evidence Blindness in Direct Corpus Interaction: Persistent Navigation with AtlasNav

摘要

大语言模型智能体正从传统的检索增强生成转向与外部语料的直接交互。直接语料交互(DCI)保持完整语料可访问,但在有限交互预算下,可触及的证据仍可能无法被利用。所需证据可能未能浮现,已浮现的支持文档可能未被打开,或已打开的文档可能未能暴露其决定性片段。我们将这种渐进的静默损失称为证据盲区(Evidence Blindness),并通过分阶段证据实现来量化它。在DCI范式中,原始交互几乎不增加可复用的语料组织,而动态工作区方法从每个查询及其轨迹重建以查询为条件的交互空间。在这两种情况下,有用的结构在很大程度上是在线恢复的。我们转而将大规模Agentic搜索形式化为对可复用语料结构的有限预算导航。我们提出AtlasNav,一个持久的多视图语料导航框架,它保留直接语料交互,但将语料一次性组织成语料图集(Corpus Atlas),让每个查询自适应地导航而非重建共享结构。在BrowseComp-Plus上,AtlasNav达到92.05%的严格准确率,同时将记录的在线推理成本较先前的动态工作区最先进方法降低30.21%。在匹配预算下,它更早实现完整所需证据,并更快逼近同一模型在提供证据条件下的经验参照。同样的表示原理在PhantomWiki不同的语料组织与受控的10K-1M规模扩展下依然有效,并具竞争力地迁移到异构的企业知识。这些结果表明,Agentic搜索不仅取决于证据是否可访问,还取决于语料如何被表示,从而使有限的交互成为有效的导航。

直接语料交互中的证据盲区:用AtlasNav实现持久化导航:论文配图
图1:AtlasNav与证据盲区。(a) 持久多视语料图集(Corpus Atlas)的离线构建。(b) 查询自适应的有限预算导航。(c) 分阶段的证据盲区诊断,片段级Qrel使Locate可直接度量。