论文
EAR:用于检索增强生成开发的实体感知分区方法
EAR: Entity-Aware Partitioning Approach for Retrieval-Augmented Generation Development
摘要
检索增强生成(RAG)可以改善知识密集型问答,但第一个设计选择很容易被忽视:源语料库应该如何划分为可检索单元?固定大小的块通常会返回很长的段落,其与问题的关系只是隐式的。我们介绍 EAR,一种用于多项选择题回答 (MCQA) 的实体感知分区方法。 EAR 从问题、答案选项和语料库中提取标准化表面锚点;检索匹配语料库锚点周围的本地窗口;并可以通过提取摘要附加更大的父段落。我们在清理后的大规模多任务语言理解 (MMLU) 式子集上评估 EAR,该子集由自动语料库支持启发式选择的 153 个问题组成,并使用净化后的公共教科书文本。在使用 Mistral、Gemma 和 DeepSeek 的相同协议 top-k = 3 和 top-k = 8 扫描中,EAR 实体窗口相对于块将检索到的单词减少了 37.5-40.2%。观察到的准确度变化在 top-k = 3 时为 +5.2、+1.3 和 -3.9 点,在 top-k = 8 时为 +5.9、-3.3 和 -4.6 点;实体窗口差异均不具有统计显着性。范围贡献是方法论上的:EAR 提供了一个紧凑且可检查的检索单元,而其基于规则的锚点提取器仍然是特定于领域的,并且需要在传输之前进行单独验证。