论文

面向远程监测的多模态临床时间序列 LLM 摘要基准评测

Benchmarking LLM Summaries of Multimodal Clinical Time Series for Remote Monitoring

模型评测评测方法与指标

摘要

大语言模型(LLM)能为远程治疗监测时间序列生成流畅的临床摘要。然而,这些叙述是否忠实捕捉临床显著事件(如持续异常)仍不清楚。现有评估指标主要关注语义相似度和语言质量,事件级正确性基本未被测量。为填补这一空白,我们利用 Technology-Integrated Health Management(TIHM)-1.5 痴呆监测数据集,提出一个面向多模态时间序列摘要的事件评估框架。临床日常事件通过基于规则的异常阈值和时间持续性标准导出。然后将模型生成的摘要与这些结构化事实对齐。我们的评估协议测量异常召回率、持续时长召回率、测量覆盖率和幻觉事件提及。我们评测三种方法:零样本提示、统计提示,以及使用渲染时间序列可视化的视觉流水线。结果揭示传统指标与临床事件保真度之间显著脱节。语义相似度得分高的模型常常表现出接近零的异常召回率。相比之下,基于视觉的方法展现出最强的事件对齐,异常召回率达 45.7%,持续时长召回率达 100%。这些发现凸显了事件感知评估对确保可靠临床时间序列摘要的重要性。

面向远程监测的多模态临床时间序列 LLM 摘要基准评测
图1:所提出的面向临床时间序列摘要的事件式评估框架概览。左:摘要生成流水线,包括(1)通过信号分割与绘图渲染进行的基于图像的视觉–语言摘要,以及(2)采用聚合数值特征的结构化统计提示。两条流水线均从原始生理数据生成每日LLM摘要。右:基于事件的事实一致性评估。真值临床事件通过基于规则的阈值化推导得到,以检测异常及其持续时长。生成的摘要使用严格事件匹配(临床事实召回)与测量覆盖分析进行评估,产生召回率与覆盖率分数,在基于参考的语义相似度指标之外量化事件级正确性。