论文

ClinicalBench:MIMIC-IV 上跨入院临床 QA 的压力测试断言感知检索

ClinicalBench: Stress-Testing Assertion-Aware Retrieval for Cross-Admission Clinical QA on MIMIC-IV

上下文与知识检索增强

摘要

推理基准衡量干净输入的临床表现。我们评估推理之前的步骤:检索真实的 EHR 记录,其中否定、暂时性和家庭与患者归因可能会将正确答案翻转为错误答案。 EpiKG 对患者知识图中的每个事实都带有一个断言标签和一个临时性标签,然后按问题意图进行检索。 ClinicalBench 是一项包含 400 个问题的测试,涉及 43 名 MIMIC-IV 患者,涉及 9 个断言敏感类别。 7 条件消融测试了 6 个 LLM(Claude Opus 4.6、GPT-OSS 20B、MedGemma 27B、Gemma 4 31B、MedGemma 1.5 4B、Qwen 3.5 35B)中的每块 EpiKG。三位医生盲目地判定了 100 个配对项目。作者不知情的主要终点,即由两位外部医生对 50 个一致严格的项目进行完全配对的 McNemar 配对,产生 +22.0 个百分点(95% Newcombe CI [+5.1, +31.5],p=0.0192)。架构新颖性、意图感知 KG-RAG 超过 Contriever 密集 RAG 基线(排除变更的 n=362 端点上的 C2b 到 C4g_kw)+8.84 个百分点(配对 McNemar p=1.79e-3);在甲骨文意向下+12.43个百分点。敏感性方向一致:三名医生多数+24.0 个百分点(受限于单作者循环性);确定性关键词再现性代理+39.5 个百分点。在六个模型中,随着 LLM 单独基线的上升,增益缩小(beta=-1.123,r=-0.921,p=0.009)。当 n=6 时,这看起来更像是回归均值,而不是用编码代替模型大小。医生裁决发现 56% 的自动生成参考答案有缺陷,这一方法学发现表明 NLP 管道临床 QA 基准需要医生裁决才能使用。 ClinicalBench、冻结评​​估器、三评估器裁决数据和 EpiKG 输出堆栈已公开发布。