论文

自适应分块:优化 RAG 的分块方法选择

Adaptive Chunking: Optimizing Chunking-Method Selection for RAG

上下文与知识上下文工程

摘要

检索增强生成 (RAG) 的有效性很大程度上取决于文档的分块方式,即将文档分割成更小的单元以进行索引和检索。然而,常用的“一刀切”方法往往无法捕捉不同文本的细微结构和语义。尽管分块具有核心作用,但它缺乏专门的评估框架,因此很难独立于下游性能来评估和比较策略。我们通过引入自适应分块来挑战这种范式,该框架根据一组五个新颖的内在的、基于文档的指标为每个文档选择最合适的分块策略:参考完整性(RC)、分块内聚(ICC)、文档上下文连贯性(DCC)、块完整性(BI)和大小合规性(SC),它们直接评估跨关键维度的分块质量。为了支持这个框架,我们还引入了两个新的分块器,一个 LLM-regex 拆分器和一个拆分然后合并递归拆分器,以及有针对性的后处理技术。在跨越法律、技术和社会科学领域的多样化语料库中,我们的度量引导自适应方法显着提高了下游 RAG 的性能。在不改变模型或提示的情况下,我们的框架提高了 RAG 结果,将答案正确率提高到 72%(从 62-64%),并将成功回答的问题数量增加了 30% 以上(65 比 49)。这些结果表明,自适应的、文档感知的分块在一套互补的内在指标的指导下,为更强大的 RAG 系统提供了一条实用且有效的途径。代码可在 https://github.com/ekimetrics/adaptive-chunking 获取。