论文

医疗保健互操作性的闭环验证修复:临床模式合规性的多模型研究 LLM

Closed-Loop Validation-Repair for Healthcare Interoperability: A Multi-Model Study of Schema Compliance in Clinical LLMs

模型推理推理验证与自校正

摘要

医疗保健互操作性要求人工智能系统产生符合标准化模式的结构化输出,包括用于诊断编码的 ICD-10、用于程序计费的 CPT 和用于数据交换的 HL7 FHIR。虽然 大语言模型 展示了临床推理能力,但它们与电子健康记录系统的集成面临着一个关键障碍:模式不合规。我们通过跨十个医学专业的 320 个临床场景的本地部署,评估了三种开源模型:Qwen2.5 7B、Llama 3.1 8B 和 Gemma2 9B,产生了在配对基线和验证修复条件下评估的 960 个模型场景对。首先,三个模型系列的模式不合规性是一致的,尽管架构和训练数据不同,但基线合规率在 85.9% 到 91.6% 之间,这表明医疗训练语料库中存在共同的差距,而不是模型特定的限制。其次,验证器检测到的失败中 96% 是表示级格式违规,例如替代医学缩写和代码前缀,这表明模型遵循临床写作惯例,但缺乏对医疗保健 IT 标准的认识。第三,验证修复框架实现了 99.0% 的总体合规性,跨模型的合规性范围为 98.4% 到 99.4%,大多数错误在一两次迭代内得到解决。精确的 McNemar p 值低于 0.001,模型大小的绝对改进为 7.8 至 12.5 个百分点,证实了统计显着性。这些结果支持闭环验证修复作为医疗保健互操作性的有效系统级保障,提高下游临床系统集成的模式级准备情况。