论文
用大语言模型作为合成临床专家辅助纵向罕见病建模
Large language models as synthetic clinical experts to inform longitudinal rare-disease modeling
摘要
由于信息量有限,纵向罕见病数据的建模可以通过整合临床知识而受益。然而,专家知识的获取及其面向模型拟合的形式化颇具挑战,尤其因临床专家时间有限。为了在模型拟合期间仍能利用领域知识,我们使用大语言模型(LLM)作为合成临床专家,监督一个基于变分自编码器的方法,该方法学习就诊级别观测的低维潜在摘要。具体而言,LLM在离线状态下针对患者观测的文本描述被查询以获得判断,例如疑似临床类别。为改进变分自编码器的拟合,我们在这些判断上训练一个可微代理模型,并增广损失函数,以鼓励重建保留其对应输入画像的临床标签分布。在应用于脊髓性肌萎缩症(SMA)患儿的纵向运动功能评估时,我们把就诊级临床画像映射为低维表示,并用多变量混合效应模型将它们联系起来。合成专家损失阻止那些在数据空间中数值接近却改变重建运动功能画像临床解释的重建,例如跨越疾病类型边界。由此我们把SMA类型标签的原始与重建不一致率从约11%降至7%。此外,相比无监督潜在表示与数据级基线,用合成专家信息指导潜在表示改善了对运动功能里程碑的预测。这些结果表明,把LLM纳入模型拟合可以让临床知识服务于表示学习,并提升纵向罕见病数据的临床保真度。
