论文
大语言模型是近似生存估计器
Large Language Models are Approximate Survival Estimators
摘要
生存分析根据患者协变量估计事件发生时间结果,并广泛用于医疗风险评估。诊断后寻求预后信息的患者可能会转向大语言模型(LLM),现在可以通过消费者应用程序轻松访问。然而,大语言模型是否能够提供准确的生存预测尚未得到严格评估。我们引入了 Survprompt,这是一个框架,可将结构化患者协变量转换为自由文本临床插图,并提示预先训练的大语言模型来预测生存零样本。我们将 Survprompt 与传统生存模型(包括随机生存森林 (RSF))进行基准测试,涉及两个多机构泛癌症队列:公开的 MSK-CHORD 队列和来自普罗维登斯圣约瑟夫健康网络的新策划队列,使用基于大语言模型的医学抽象框架构建。我们报告审查的平均绝对误差(cMAE)和一致性指数(c-index),并进行特征消融以确定影响 LLM 预测的变量。前沿大语言模型在个人生存时间方面取得了令人惊讶的竞争性 cMAE。例如,在 MSK-CHORD 中,GPT-5.6-Sol 的 cMAE 与经过专门训练用于多种癌症类型生存预测的最先进 RSF 模型相比,cMAE 误差在 10% 以内,并且在 MSK-CHORD 中的前列腺癌 cMAE 低于 RSF。特征消融显示,大语言模型优先考虑临床变量,类似于专门的生存模型。然而,大语言模型在不同癌症类型和机构之间表现出不一致的准确性,并且对高风险和低风险患者(较低的 c 指数)的区分很差。零样本大语言模型无需专门训练即可产生令人惊讶的准确预后估计,但其在癌症类型和机构中的不同表现仍然是临床使用的重要限制。