论文

检索增强生成中表格数据的结构感知分块

Structure-Aware Chunking for Tabular Data in Retrieval-Augmented Generation

上下文与知识上下文工程

摘要

CSV 和 Excel 文件等表格文档广泛应用于企业数据管道中,但现有的检索增强生成 (RAG) 分块策略主要针对非结构化文本而设计,并未考虑表格结构。我们提出了一种结构感知表格分块(STC)框架,该框架通过构建分层行树表示来对行级单元进行操作,其中每一行都被编码为键值块。 STC 执行与结构边界对齐的词元约束拆分,并应用无重叠贪婪合并来生成密集、不重叠的块。这种设计保留了行内字段之间的语义关系,同时提高了词元利用率并减少了碎片。在 MAUD 数据集的评估中,与标准递归和基于键值的基线相比,STC 分别减少了高达 40% 和 56% 的块计数,同时提高了词元利用率和处理效率。在检索基准中,STC 在混合设置中将 MRR 从 0.3576 提高到 0.5945,并将仅 BM25 检索中的 Recall@1 从 0.366 提高到 0.754。这些结果表明,在分块过程中保留结构可以提高检索性能,凸显了 RAG 的结构感知分块相对于表格数据的重要性。