论文

消费类硬件上的 GraphRAG:针对医疗保健 EHR 模式检索的本地 LLM 基准测试

GraphRAG on Consumer Hardware: Benchmarking Local LLMs for Healthcare EHR Schema Retrieval

模型评测模型能力评测

摘要

基于图的检索增强生成(GraphRAG)扩展了检索增强生成以支持复杂语料库的结构化推理,但其在资源受限、隐私敏感的部署下的可靠性仍不清楚。在医疗保健领域,电子健康记录 (EHR) 数据复杂且受到严格监管,对基于云的 大语言模型 (LLM) 的依赖带来了成本、延迟和合规性方面的挑战。在这项工作中,我们使用本地部署的开源 LLM 对用于 EHR 模式检索的 GraphRAG 进行了系统评估。我们在现实世界的 EHR 架构文档上实现了 Microsoft GraphRAG 管道,并对四个模型进行了基准测试,包括 Llama 3.1 (8B)、Mistral (7B)、Qwen 2.5 (7B) 和 Phi-4-mini (3.8B),每个模型都通过 Ollama 部署在单个消费级 GPU (8 GB VRAM) 上。我们评估全局和局部检索模式下的索引效率、知识图构建、查询延迟、答案质量和幻觉。我们的结果揭示了显着差异:Llama 3.1 生成最丰富的知识图(1,172 个实体),Qwen 2.5 实现最佳答案质量(3.3/5),Phi-4-mini 由于结构化输出错误而未能完成管道,而 Mistral 表现出退化重复行为。我们进一步表明,GraphRAG 表现出实际的容量阈值,其中低于大约 7B 参数的模型无法可靠地生成有效的结构化输出,并且无法完成管道。此外,索引和答案质量在模型之间是解耦的,本地检索在延迟和事实基础上始终优于全局摘要,并且减少了幻觉。这些发现表明 GraphRAG 在消费类硬件上是可行的,同时强调了模型选择和检索设计对于在监管环境中稳健部署的重要性。