论文

使用LLM的面向决策支持的上下文感知住院预测评估

Context-Aware Hospitalization Forecasting Evaluations for Decision Support using LLMs

模型评测模型能力评测

摘要

在大规模医疗中断(如运营故障或大流行病)期间,医学与公共卫生专家必须依据预测的住院趋势做出实时资源决策,例如扩充医院床位容量。预测模型可以通过分析设施层面的大量资源相关数据来协助这一任务,但它们必须在真实世界数据条件下对决策而言足够可靠。近期工作表明,大语言模型(LLM)能在数值预测中纳入更丰富的上下文形式。传统模型主要依赖时间上下文(即历史观测),而LLM还能利用非时间的公共卫生上下文,如人口统计学、地理和人群层面特征。然而,在真实医疗场景中应如何使用这些模型以产生稳定或与决策相关的预测,仍不清楚。为评估LLM在此场景中的有效使用方式,我们在美国60个住院强度为低、中、高的县上评估三种方法:直接基于LLM的预测、经典时间序列模型,以及把LLM衍生信号纳入结构化模型的上下文增强混合流水线(HybridARX)。由于目标是运营决策而非单纯的误差最小化,我们在标准预测指标之外还用偏差和超前-滞后对齐来评估性能。我们的结果显示,HybridARX相比经典ARX能产生更稳定、校准更好的预测,尤其是在把含噪上下文信号纳入结构化时间序列模型时。这些发现表明,在非平稳的医疗资源预测中,LLM最有用的方式是嵌入结构化混合模型之中。

使用LLM的面向决策支持的上下文感知住院预测评估:论文配图
图 2:候选领先指标与县级 14 天平均 COVID-19 住院人数之间的皮尔逊相关系数。医院容量测量和嗅觉丧失/味觉丧失搜索量表现出最强的正相关性。