论文
TCMClinicalReason-Bench:语言模型能否根据真实临床病例从发病机制推理到处方?
TCMClinicalReason-Bench: Can Language Models Reason from Pathogenesis to Prescription over Real-World Clinical Cases?
摘要
大语言模型 (LLM) 可以生成没有充分基于患者特定证据的临床叙述。在中医中,错误可以从病因病机、辨证论治原则到处方产生等传播。我们使用 2,000 个多中心电子健康记录病例开发了 TCMClinicalReason-Bench,以区分基于病例的反应与流畅但无支持的诊断和治疗结论。在零样本设置下评估了五个通用LLM和两个 TCM 专用LLM。证据有限的评估标准评估了七个诊断和治疗成分以及三个跨模块关系,从而允许病例支持的替代方案。具有中医检索功能的 Qwen3.7-Plus 充当自动判断者,同时由五位高级中医临床医生对 600 个病例子集进行平行盲评。结构完整性接近饱和(99.3-100.0%),但标准化内容得分范围为 40.7% 至 54.1%。五个通用模型的平均率为 50.0%,而两个较小的 TCM 专用模型的平均率为 41.3%。跨块逻辑一致性范围为 60.8% 到 66.8%,并且与跨案例的内容适度相关(Pearson's r = 0.515-0.656)。处方生成、处方分析和症状指导修改方面的缺陷最为严重。在对 100 个独立案件进行的法官压力测试中,这三种关系的扰动检测率分别为 57%、56% 和 31%,矛盾检测比遗漏检测更可靠。将组件质量与跨块一致性分开可以定位端点和完整性指标遗漏的故障,并确定临床医生仍需要监督的地方。