论文

将结构化生物医学知识注入语言模型:持续预训练与 GraphRAG

Injecting Structured Biomedical Knowledge into Language Models: Continual Pretraining vs. GraphRAG

上下文与知识知识获取与更新

摘要

特定领域知识的注入对于使语言模型(LM)适应生物医学等专业领域至关重要。虽然当前大多数方法依赖于非结构化文本语料库,但本研究探索了两种利用 UMLS Metathesaurus 结构化知识的互补策略:(i) 将知识嵌入模型参数的持续预训练,以及 (ii) 在推理时查阅知识图的图检索增强生成 (GraphRAG)。我们首先从 UMLS 构建一个大规模的生物医学知识图(340 万个概念和 3420 万个关系),存储在 Neo4j 中以进行高效查询。然后,我们从该图中导出约 1 亿个标记的文本语料库,以持续预训练两个模型:BERTUMLS(来自 BERT)和 BioBERTUMLS(来自 BioBERT)。我们在涵盖五种任务类型的六个 BLURB(生物医学语言理解和推理基准)数据集上评估这些模型,并在两个 QA(问题解答)数据集(PubMedQA、BioASQ)上评估 GraphRAG。在 BLURB 任务上,BERTUMLS 比 BERT 有所改进,在知识密集型 QA 上的收益最大。对 BioBERT 的影响更加微妙,表明当基本模型已经编码了大量生物医学文本知识时,回报会递减。最后,使用我们的 GraphRAG 管道增强 LLaMA 3-8B,可以在 PubMedQA 上获得超过 3 分的准确度,在 BioASQ 上获得超过 5 分的准确度,无需任何再训练,从而提供透明、多跳且易于更新的知识访问。我们发布了处理后的 UMLS Neo4j 图以支持再现性。