论文

知识图谱证据仅对训练外知识改善LLM表现:临床问答的对照研究

Knowledge-Graph Grounding Helps LLMs Only for Out-of-Training Knowledge: A Controlled Study on Clinical Question Answering

模型评测模型能力评测

摘要

《自然医学》最近的一项研究报告称,通用前沿 LLM 在医学基准上优于专门的检索增强临床工具,并且检索可能会损害强大的模型。我们自然会问:结构化知识图(KG)基础是否会改变这一点,以及什么时候基础有帮助?我们贡献了两个结果。首先,再现:该研究的标题 HealthBench 分数(约 88)是共识变体,而不是完整的 HealthBench,其中前沿模型和理想完成度在医生校准的评分器下的得分都约为 46-47(一致性为 82.5%);我们重现了 GPT-5.2 共识 =90.9 并标记了一个导致分数下降的评分错误。第二,知识边界结果。在公共生物医学 KG PrimeKG 上使用图+向量引擎(samyama-graph),无论是朴素的三元组检索还是代理的自然语言到 Cypher 循环(82% 成功的查询)都在弱到强的模型阶梯上改进了 MedQA(所有 |Delta| <= 3.4)。在合成反事实 KG 上,以及在混合已知事实和新颖事实的混合基准上,相同的管道将训练外的准确率从偶然性提升到约 100%(+68 到 +79),同时不添加任何已知事实(无 LLM 手臂同时回答这两个问题)。在三种制度(无知识、图形辅助、混合)中,只有当决定性事实位于模型训练之外时,图谱证据才有帮助——公共知识图谱事实是多余的,私人和新颖的数据才是有价值的——与研究的机构数据警告相匹配。