论文

ANCHOR-RE:用于扎根生物医学关系提取的代理神经符号框架

ANCHOR-RE: An Agentic Neuro-Symbolic Framework for Grounded Biomedical Relation Extraction

模型推理推理验证与自校正

摘要

生物医学关系提取(BioRE)从生物医学文献中提取结构化知识,用于知识库构建和假设生成等应用。 SemRep 等传统符号系统提供高精度但召回率有限,而 大语言模型 (LLM) 提供更强的上下文推理,但仍然容易出现误报预测。我们开发了ANCHOR-RE,一个将本体引导推理、外部知识基础和数据驱动验证规则集成到LLM推理中的框架。我们使用专有和开放权重 LLM 在三个 BioRE 基准(SemRepGS、DDI 和 ChemProt)上对其进行了评估。为了评估基准数据集之外的普遍性,同时减少 LLM 预训练污染带来的潜在评估偏差,我们使用 2026 年发表的 100 篇生物医学文章进行了时间评估。借助专有主干网,ANCHOR-RE 的表现优于直接 LLM 提示,将 SemRepGS 上的 micro-F1 从 0.654 提高到 0.676,从 0.769 提高到 0.769。 DDI 上为 0.872,ChemProt 上为 0.939 至 0.941。在 DDI 和 ChemProt 上,它的性能也优于之前报道的仅推理方法,并且接近微调或指令调整的系统,而无需更新参数。使用开放权重 LLM 观察到的类似性能提升表明,好处不仅限于专有主干网。在截止后集上,对 500 个随机采样的预测进行手动评估,得出的精度为 69%,与以前未见过的生物医学文献保持一致的精度。神经符号推理可以提高基于 LLM 的 BioRE 的可靠性,而无需 微调。多个基准、模型系列和截止后文献的结果支持 Anchor-RE 作为生物医学文献挖掘的实用 无需训练 方法。