论文

面向生物医学文献检索增强生成的图感知延迟分块

Graph-Aware Late Chunking for Retrieval-Augmented Generation in Biomedical Literature

上下文与知识检索增强

摘要

面向生物医学文献的检索增强生成(RAG)系统通常使用平均倒数排名(MRR)等排序指标评估,这类指标衡量系统识别单一最相关文本块的能力。我们认为,对于全文科学文献,这一范式并不完整:它奖励检索精度,却忽视检索广度——即从文档各结构化章节中挖掘证据的能力。我们提出 GraLC-RAG,一个将延迟分块(late chunking)与图感知结构智能相统一的框架,引入结构感知的文本块边界检测、UMLS 知识图谱注入和图引导的混合检索。我们在 2,359 篇经 IMRaD 筛选的 PubMed Central 文章上,使用 2,033 个跨章节问题和两类指标评估了六种策略:标准排序指标(MRR、Recall@k)和结构覆盖指标(SecCov@k、CS Recall)。结果揭示出鲜明的分化:内容相似度方法取得最高 MRR(0.517),但总是仅从单一章节检索,而结构感知方法的检索章节数最多可达其 15.6 倍。生成实验显示,知识图谱注入式检索将答案质量差距缩小至 delta-F1 = 0.009,同时保持 4.6 倍的章节多样性。这些发现表明,标准指标系统性低估了结构化检索的价值,而弥合多章节综合差距是生物医学 RAG 的一个关键开放问题。

面向生物医学文献检索增强生成的图感知延迟分块:论文配图
图 1:GraLC-RAG 框架架构。第一阶段:文档解析产生结构图和UMLS知识子图。第 2 阶段:全文档转换器编码。第 3 阶段:通过 GAT 注意进行 KG 输注。第 4 阶段:结构感知边界检测和块嵌入。阶段 5:图引导混合检索。