论文

监管文档RAG中解析、切分与嵌入模型的交互评测

Parser, Chunking, and Embedding Interactions in Retrieval-Augmented Generation over Indian Government Regulatory Documents

模型评测上下文与知识上下文工程检索增强评测方法与指标

摘要

检索增强生成(RAG)流水线通常由独立选择的文档解析器、切分策略和嵌入模型组装而成,但这些选择很少联合评估;即使联合评估,也通常只在单个文档或语料上进行。我们开展受控因子研究,比较三个解析器、三种切分策略、五种稠密嵌入模型以及稀疏BM25基线,覆盖四份结构不同的印度中央政府监管文档和800个问题实例。每个问题有一条或多条必需证据字符串;证据先自动对照原文验证,再人工复核10%的随机样本。我们对72000行结果拟合具有文档查询级随机截距的线性混合效应模型,在匹配稠密与稀疏配置之间开展Holm校正的配对比较,并为54个唯一检索配置报告聚类自助法置信区间。结果显示,没有单一检索器家族在全部文档上占优;解析器与切分器选择存在显著交互;MPNet-base持续较弱,在表格来源问题上有严重失效模式;语料的证据保留上限接近饱和且超过98%,意味着检索差异主要源于排序质量而非摄取中的信息丢失。我们还报告嵌入维度、块大小与重叠的消融,以及效率质量Pareto分析。完整评测Harness、语料清单和800问题基准将公开。