论文

我们可以使用 LLM 生成临床时间序列数据的便携式表示吗?

Can we generate portable representations for clinical time series data using LLMs?

应用与实践行业应用

摘要

临床机器学习的部署既缓慢又脆弱:在一家医院工作的模型经常会在另一家医院的分布变化中退化。在这项工作中,我们研究了一个简单的问题——大语言模型 (LLM) 能否创建便携式患者嵌入,即患者的表示能够使建立在一家医院上的下游预测器能够在其他地方使用,而无需再训练和 微调。为此,我们使用冻结的 LLM 将不规则的 ICU 时间序列映射到简洁的自然语言摘要,然后使用冻结的文本嵌入模型嵌入每个摘要,以获得能够作为各种下游预测器的输入的固定长度向量。在三个队列(MIMIC-IV、HIRID、PPICU)中,在多个基于临床的预测和分类任务中,我们发现我们的方法简单、易于使用,并且与网格插补、自监督表示学习和时间序列基础模型的分布相比具有竞争力,同时在转移到新医院时表现出较小的相对性能下降。我们研究提示设计中性能的变化,结构化提示对于在不改变平均准确性的情况下减少预测模型的方差至关重要。我们发现,使用这些便携式表示可以改善小样本学习,并且不会增加相对于基线的年龄或性别的人口可恢复性,这表明几乎没有额外的隐私风险。我们的工作表明,LLM 作为工具具有通过减少工程开销来实现生产级预测模型的可扩展部署的潜力。