论文

临床推理图:LLM 诊断推理的结构化评估揭示了缺乏一致性的能力

Clinical Reasoning Graphs: Structured Evaluation of LLM Diagnostic Reasoning Reveals Competence Without Consistency

模型评测上下文与知识本体模型行为与机制分析

摘要

现代 大语言模型 (LLM) 在复杂的临床病例基准上达到 60-70% 的诊断准确性,但仅凭准确性无法区分稳定的临床推理与模式匹配。我们引入了临床推理图,即使用具有 5 种节点类型和 7 种边缘类型的基于领域的本体从自由文本 LLM 诊断跟踪中提取的结构化图表示。我们将此管道应用于 50 个新英格兰医学杂志临床病理学会议病例和三个提示条件中的 5 个 LLM 的 750 个迹线,并测试诊断迹线对于临床相似的病例是否显示稳定的结构化推理模式或诊断模式。我们将此操作为临床相似病例之间的图形相似性高于临床不同病例之间的图形相似性。在 15 个模型条件比较中,簇内和簇间的复合相似性几乎相同,并且没有任何比较能够通过多重测试校正;组件级分析发现任何残留内容信号远低于模式规模。对于既正确 (0.488) 又不正确 (0.484) 的模型对,图相似性也几乎相同,这表明图结构捕获了诊断准确性中未反映的维度。结构化反射提示增加了迹线内的显式判别特征分析(+33%),但没有增加跨案例的一致性。这些结果显示了在没有图式规模推理一致性的情况下的诊断能力,并表明最终答案的准确性应该通过过程级评估来补充。我们发布了本体、提取管道、验证协议以及提取的推理图和相似性工件,作为 LLM 临床推理的结构化评估的资源。