论文

Synthetic Hospital:开放、可验证、经医师验证的纵向电子病历基准

Synthetic Hospital: An Open, Verifiable, Physician-Validated Longitudinal EHR Benchmark

模型评测上下文与知识本体基准与评测资源

摘要

前沿语言模型很少用于临床工作流,因为开发它们所需的现实纵向基准十分稀缺。真实电子健康记录(EHR)数据因隐私、伦理或数据使用问题无法公开共享,且不包含可验证的ground truth,因为病历只反映临床医生记录的内容。我们介绍Synthetic Hospital,一个开放、全合成、事实落地的纵向EHR基准,解决了开放共享和可验证ground truth两大障碍。它完全由公开医学教育材料构建,不含受保护健康信息,包含1,268名纵向患者和5,602次就诊,每个诊断、发现和时间关系都落地于标准本体(ICD-10-CM、SNOMED CT、LOINC),并具有回溯至来源医学教育材料的完整溯源链。Synthetic Hospital通过一个模拟医院记录系统提供,该系统镜像真实EHR基础设施(标准互操作API、基于角色的访问和函数调用接口)。在盲评中,医师以接近随机的概率(53%)区分其记录与真实病历。跨10个前沿和开放模型,无一接近天花板:最佳模型以严重度加权F1 0.73重建患者的纵向问题列表,与匹配子集上七位医师的平均水平相当但远低于其中最佳者(0.89),且在总结病历时遗漏大约一半的临床相关发现。总体而言,这些结果凸显Synthetic Hospital是对临床AI性能的一次困难而现实的检验。

Synthetic Hospital:开放、可验证、经医师验证的纵向电子病历基准:论文配图
图 1:Synthetic Hospital、其源语料库与 Synthea 的 ICD-10 章节分布。Synthetic Hospital 紧密遵循其源语料库源自教育场景的病例构成,而面向人群的 Synthea 队列则以 Z00–Z99 就诊为主。