论文
FeatEHR-LLM:利用 大语言模型 进行电子健康记录中的特征工程
FeatEHR-LLM: Leveraging Large Language Models for Feature Engineering in Electronic Health Records
摘要
电子健康记录 (EHR) 的特征工程由于不规则的观察间隔、可变的测量频率以及临床时间序列固有的结构稀疏性而变得复杂。现有的自动化方法要么缺乏临床领域意识,要么假设干净、定期采样的输入,限制了它们对现实世界 EHR 数据的适用性。我们提出了 \textbf{FeatEHR-LLM},一个利用 大语言模型 (LLM) 从不规则采样的 EHR 时间序列生成具有临床意义的表格特征的框架。为了限制患者隐私暴露,LLM 仅在数据集模式和任务描述上运行,而不是在原始患者记录上运行。工具增强的生成机制为 LLM 配备了用于查询不规则时间数据的专用例程,使其能够生成可执行的特征提取代码,明确处理不均匀的观察模式和信息稀疏性。 FeatEHR-LLM 通过迭代、循环验证管道支持单变量和多变量特征生成。通过对四个 ICU 数据集的八个临床预测任务进行评估,我们的框架在 8 个任务中的 7 个上实现了最高的平均 AUROC,与强基线相比提高了高达 6 个百分点。代码可在 github.com/hojjatkarami/FeatEHR-LLM 获取。