论文
具有标题链前缀的结构感知语义分块:文本转换消融中的 1600 条查询评估和测量陷阱
Structure-Aware Semantic Chunking with Title-Chain Prefixes: A 1600-Query Evaluation and the Measurement Trap in Text-Transform Ablations
摘要
分块是检索增强生成 (RAG) 中的第一个也是最重要的步骤:每个下游检索决策都会继承块边界。我们提出了一个三阶段、仅限块侧的语义分块管道——标题分割、语义合并和标题链前缀——额外的 LLM 调用成本为零:标题链重用文档自己的标题层次结构而不是生成的摘要。在对生产 Markdown 知识库进行 1600 个查询分层评估时,该管道将整个集上的 MRR@5 从 0.374 提高到 0.463 (+23.8%),将可回答子集 (n=563) 从 0.828 提高到 0.925 (+11.7%),双注释器 Cohen 的 kappa 为 0.45(未加权, 16,000 个分数对)。然后,我们报告我们尝试过的内容和失败的内容:三个查询端或架构级后续措施是设计死胡同(未评估——没有可比较的运行工件),一个测量到的失败(前缀权重衰减),以及一个协议级失败,这是本文的中心方法论发现。在同池前缀开/关消融中,在相同的提示下,双注释器协议从 kappa 0.45 崩溃到 0.04——剥离标题链上下文就剥离了注释器需要就相关性达成一致的消歧信号。这种测量陷阱使分块研究中的常见评估实践无效,并激发了检索时间每个候选前缀评估,这是我们从所有证据中推荐的方向。