论文

检索对齐的表格基础模型在真实世界约束下实现电子健康记录的稳健临床风险预测

Retrieval-aligned Tabular Foundation Models Enable Robust Clinical Risk Prediction in Electronic Health Records Under Real-world Constraints

上下文与知识检索增强

摘要

从结构化电子健康记录(EHR)进行临床预测因高维、异构性、类别不平衡与分布偏移而颇具挑战。尽管表格上下文学习(TICL)与检索增强方法在通用基准上表现良好,其在临床环境中的行为仍不清楚。我们提出一个多队列EHR基准,在不同数据规模、特征维度、结局稀有度与跨队列泛化维度上比较经典方法、深度表格模型与TICL模型。基于PFN的TICL模型在低数据条件下样本高效,但随着异构性与不平衡加剧,在朴素的基于距离的检索下性能退化。我们提出AWARE,一个采用监督嵌入学习与轻量适配器的任务对齐检索框架。AWARE在极端不平衡下将AUPRC提升最多12.2%,且增益随数据复杂度增加而增大。我们的结果将检索质量与检索-推理对齐确定为在临床预测中部署表格上下文学习的关键瓶颈。

检索对齐的表格基础模型在真实世界约束下实现电子健康记录的稳健临床风险预测:论文配图
图 1:EHR 基础模型的主要学习范式的概念比较,说明了本机表格模型、基于顺序事件的模型、基于语言的抽象和表格上下文学习之间的表示、适应策略和计算权衡的差异。 ✓突出优势,同时✗突出劣势。