论文

向量检索中的语义纠缠:面向智能体RAG系统的形式化框架与上下文条件化解缠流水线

Semantic Entanglement in Vector-Based Retrieval: A Formal Framework and Context-Conditioned Disentanglement Pipeline for Agentic RAG Systems

上下文与知识上下文工程检索增强

摘要

检索增强生成(Retrieval-Augmented Generation,RAG)系统依赖向量表示的几何属性来检索上下文恰当的证据。当源文档在连续文本中交织多个主题时,标准向量化所产生的嵌入空间会让语义不同的内容占据重叠的邻域。我们将这种状况称为语义纠缠(semantic entanglement)。我们将纠缠形式化为嵌入空间中跨主题重叠的模型相对度量,并定义纠缠指数(Entanglement Index,EI)作为定量代理。我们论证更高的EI会约束余弦相似度检索下可达到的Top-K检索精度。为解决这一问题,我们提出语义解缠流水线(Semantic Disentanglement Pipeline,SDP),一个在嵌入前重构文档的四阶段预处理框架。我们进一步提出上下文条件化预处理——文档结构由实际使用模式塑造——以及基于智能体表现调整文档结构的持续反馈机制。我们在一个真实的企业医疗知识库上评估SDP,该知识库包含横跨约25个子领域的2,000余份文档。Top-K检索精度从固定token分块下的约32%提升到SDP下的约82%,同时平均EI从0.71降至0.14。我们并不声称纠缠能完全解释RAG失败,而是认为它刻画了一种独特的预处理失效模式——一旦被编码进向量空间,下游优化便无法可靠纠正。