论文

语义压缩树:经由层次语义残差的多分辨率知识检索

Semantic Compression Trees: Multi-Resolution Knowledge Retrieval via Hierarchical Semantic Residuals

上下文与知识检索增强

摘要

检索增强生成主要依赖扁平、固定粒度的索引:文档被切成均匀块并按相似度检索,丢弃了源文档的层次结构。我们提出语义压缩树(SCT),一种层次化索引:每个节点仅存储其语义残差——即它在父节点之外新增的信息——检索则通过从根节点渐进下行完成,使每查询成本由树深度而非集合规模决定。我们在 QASPER(50 篇论文、173 个问题)上评估,采用两种仅在于基准是否提供相关文档上不同的协议,全程使用 bootstrap 置信区间和配对显著性检验。结果是喜忧参半的,我们也如实报告。当给定文档时,使用零 LLM 抽取式压缩器的 SCT 在答案质量上与稠密检索相当(0.274 对 0.277 F1,p = 0.37),上下文 token 减少 30%,且构建索引无需 LLM 调用;残差存储优于在每个节点存完整摘要(0.274 对 0.205,p < 0.001)。集合扩大 50 倍时,扁平检索的每查询打分开销乘以 48.9 倍,SCT 为 6.4 倍。但渐进下行本身未获支持:给定文档时,不用树而检索相同残差的表现相同(p = 0.27);当系统必须自行选择文档时,下行的表现显著更差(0.122 对 0.165,p < 0.001)。路由准确率定位了原因:下行仅 20.2% 的时候选中正确论文,而扁平检索为 39.3%,因为该选择基于根残差——树中被压缩得最厉害的节点。我们的结论是:残差表示值得保留,自顶向下的路由则不然。