论文
评估学术文本检索增强生成的分块策略
Evaluating Chunking Strategies for Retrieval-Augmented Generation on Academic Texts
摘要
检索增强生成 (RAG) 系统使用 大语言模型 (LLM) 的问答功能来访问其参数之外的信息。我们使用检索增强生成评估(RAGA)框架来评估与固定大小和递归分块相比,基于集群的语义分块是否可以提高检索和答案质量,从而对长篇结构化学术论文进行评估。基于 RAGA 的 忠实性 在该设置中显示出有限的可靠性。固定问题与文档特定问题的表现差异很大,可能与文档的格式和预处理有关。在测试的配置下,基于集群的分块并没有优于更简单的策略。