论文

ViSTA:冻结视觉语言底座,接入临床数值时间序列

ViSTA: A Simple Bridge Extends Visual Alignment to Clinical Time-Series Understanding in Multimodal LLMs

模型训练参数高效训练

摘要

临床预测模型根据患者测量结果估计风险,而大型语言模型支持医学文本理解和问题回答。然而,他们的语言能力并不能确保从结构化的高维临床时间序列中进行准确的预测。提高这种能力可以将风险评估与有关患者病情变化的灵活问题联系起来。我们推出了 ViSTA,这是一个紧凑的适配器,它将不规则的数值测量合并到预训练的视觉语言模型的图表表示中。它学习对视觉标记的修正,同时保持所有预训练参数不变。在 MIMIC-IV 上,在具有 2-90 亿个参数的模型中,在急性肾损伤和死亡率预测的所有四个指标的比较适应中,ViSTA 的平均得分最高。凭借 51.6万个可训练参数,20 亿参数模型的急性肾损伤 ROC 曲线下面积为 0.7376,而文本输入和高推理工作量的 GPT-5.6 Sol 的 ROC 曲线下面积为 0.7380。时间问答训练在 40 亿个参数下的准确率达到 69.27%,与使用图表或数字文本的低秩自适应相比,可训练参数减少了 90% 以上,准确率差距为 2.82-4.88 个百分点。 ViSTA 将预训练语言模型扩展到数值预测和时间问题。

ViSTA将不规则临床数值编码为潜在摘要,再以残差适配视觉token。
图2(图注摘要):ViSTA将不规则临床数值编码为潜在摘要,再以残差适配视觉token。