论文

患者不是移动的文档:面向纵向EHR的世界模型训练范式

The Patient is not a Moving Document: A World Model Training Paradigm for Longitudinal EHR

模型训练预训练

摘要

以下一词预测训练的大语言模型(LLM)已作为临床基础模型取得成功。这些语言骨干的表示在多种生物医学任务上产生强线性探针性能,表明患者语义可从大规模下一token预测中涌现。然而,这一范式把患者当作待总结的文档,而非待仿真的动力系统;患者的轨迹源于其状态在干预与时间作用下的演化,需要仿真动态而非预测token的模型。为此,我们提出SMB-Structure,一个面向结构化EHR的世界模型,将联合嵌入预测架构(JEPA)与下一token预测(SFT)相结合。SFT把模型接地于在token空间中重建未来患者状态,而JEPA仅从初始患者表示出发在隐空间预测这些未来,迫使轨迹动态在下一状态被观测之前即被编码。我们在两个大规模队列上验证:Memorial Sloan Kettering(23,319名肿瘤患者;323,000+患者年)和INSPECT(19,402名肺栓塞患者)。通过沿疾病轨迹多点评估的线性探针,我们证明该训练范式学到的嵌入能捕捉自回归基线无法恢复的疾病动态,使SMB-Structure在以高患者异质性为特征的复杂任务上取得有竞争力的表现。模型权重见 https://huggingface.co/standardmodelbio/SMB-v1-1.7B-Structure。

患者不是移动的文档:面向纵向EHR的世界模型训练范式
图1:用于 Time-to-Event EHR 建模的 SMB-Structure 架构。