论文

学习从不规则的临床时间序列中选择用于语言模型预测的来源可追溯的证据

Learning to Select Source-Traceable Evidence for Language-Model Prediction from Irregular Clinical Time Series

上下文与知识上下文工程

摘要

数值时间序列模型有效地处理不规则的电子健康记录 (EHR) 轨迹,但没有揭示哪些时间模式支持每个预测作为可读证据。现有的基于文本的界面要么序列化观察结果,保留源可追溯性,但提供有限的临床解释,要么生成患者级别的摘要,以提高可读性,但可能模糊源测量的链接。我们引入了 STEP-CTS(临床时间序列预测的来源可追踪证据),它学习为语言模型预测器选择来源可追踪的文本证据。每个轨迹的多尺度窗口统计数据被表述为确定性阈值谓词集,每个集都链接到其源窗口(例如,“[5-7 h]:最后温度至少 38C”)。离线 LLM 每个唯一谓词集运行一次,无需访问患者记录、预测任务或结果标签,将“发烧”等临床概念附加到其支持谓词上,并在不适用时放弃。每个谓词集及其概念一起形成一个证据单元。学习的证据选择器选择证据单元的固定大小子集,预训练的临床语言模型编码器读取该子集以进行预测,而无需生成患者级别的文本。在三个 ICU 基准中,STEP-CTS 的表现优于基于文本的基线评估,在 P2012、MIMIC-III 和 P2019 上分别将 AUPRC 提高了 5.1、3.7 和 11.7 个百分点,并且与专用数值时间序列模型相比具有竞争力。消融表明,临床概念和学习的证据选择都有助于预测性能。在一项盲法临床研究中,所选证据被评为可追溯的确定性序列化、接近量表的上限,并且高于临床解释生成的摘要。