论文

LLM 用于根据结构化临床数据预测心血管风险

LLMs for Cardiovascular Risk Prediction from Structured Clinical Data

应用与实践行业应用

摘要

冠状动脉疾病 (CAD) 仍然是全球主要死亡原因之一,这突出表明需要可靠的预测系统来支持早期诊断和风险评估。虽然传统的机器学习模型在结构化临床数据上表现良好,但 大语言模型 (LLM) 为解释以自然语言表达的医疗信息提供了新的可能性。在这项工作中,我们开发了一个混合框架,可以连接结构化临床数据和自然语言表示以进行 CAD 预测。使用包含 1,190 条患者记录(具有 11 个临床属性)的公开数据集,使用 LLM 将结构化变量转换为可解释的特征表示和综合临床叙述。验证流程对临床变量进行反向提取,并计算与原始记录的一致性分数,平均保真度达到 94.61%。然后,我们评估了四种传统的机器学习模型,并将它们在零样本和少样本提示设置下的性能与基于 LLM 的分类进行比较。我们这里使用两个LLM,GPT和Gemini。实验结果表明,随机森林达到了最高的准确率。尽管有这一优势,基于 LLM 的分类在现实临床环境中仍然有益。这是因为 LLM 直接对自然语言患者描述进行操作,这意味着敏感的数字患者数据(例如精确的实验室值、血压读数和诊断代码)是保密的。研究结果表明,将结构化临床数据与 LLM 生成的叙述相结合可以为混合临床预测系统带来新的方向。