论文

EveryQuery:经由基于电子健康记录的任务条件化预训练实现零样本临床预测

EveryQuery: Zero-Shot Clinical Prediction via Task-Conditioned Pretraining over Electronic Health Records

模型训练预训练

摘要

在电子健康记录(EHR)上预训练的基础模型,通过生成合成的患者未来并对采样轨迹聚合统计量,已展现出零样本临床预测能力。然而这种自回归推断流程计算代价高、统计噪声大,且不原生支持提示,因为用户无法让预测直接以特定临床问题为条件。在这项初步工作中,我们提出EveryQuery,一个通过任务条件化预训练实现零样本推断的EHR基础模型。EveryQuery不生成未来事件,而是以患者历史和指定临床任务的结构化查询为输入,通过单次前向传播直接估计结果在未来时间窗内发生的可能性。EveryQuery通过在随机采样的查询任务与患者情境组合上进行预训练来实现这一能力,直接训练模型对任意输入提示给出正确答案。这使得查询空间内的任意任务无需微调、线性探测或轨迹生成即可进行零样本预测。在MIMIC-IV上,EveryQuery在39个随机采样的预测任务中的82%上超过自回归基线,平均AUC提升+0.16(95%置信区间:[0.10,0.22])。该优势在从预训练分布中明确留出的任务上依然保持一致。此外,EveryQuery的性能增益在罕见临床事件上最为显著,证实并展示了解决自回归推断在低发生率结局上根本局限的方案。但目前,EveryQuery在需要对多个编码进行析取推理的任务上表现欠佳,例如30天再入院,暴露出当前查询语言具体的表达能力局限。

EveryQuery:经由基于电子健康记录的任务条件化预训练实现零样本临床预测:论文配图
图 1:EveryQuery 概述。自回归 EHR 模型 (a) 学习 p⁡(x)p(x) 并通过生成许多合成期货和聚合统计数据来实现零样本推理;这会产生量化的高方差估计,这对于罕见事件尤其成问题。 EveryQuery (b) 直接学习 p⁡(y∣x,q)p(y\mid x,q):它以结构化任务查询 q=(c,Δ​t)q=(c,\Delta t) 以及患者的历史记录为条件,通过单个确定性前向传递产生预测。