论文
面向远程监测的多模态临床时间序列 LLM 摘要基准评测
Benchmarking LLM Summaries of Multimodal Clinical Time Series for Remote Monitoring
摘要
大语言模型(LLM)能为远程治疗监测时间序列生成流畅的临床摘要。然而,这些叙述是否忠实捕捉临床显著事件(如持续异常)仍不清楚。现有评估指标主要关注语义相似度和语言质量,事件级正确性基本未被测量。为填补这一空白,我们利用 Technology-Integrated Health Management(TIHM)-1.5 痴呆监测数据集,提出一个面向多模态时间序列摘要的事件评估框架。临床日常事件通过基于规则的异常阈值和时间持续性标准导出。然后将模型生成的摘要与这些结构化事实对齐。我们的评估协议测量异常召回率、持续时长召回率、测量覆盖率和幻觉事件提及。我们评测三种方法:零样本提示、统计提示,以及使用渲染时间序列可视化的视觉流水线。结果揭示传统指标与临床事件保真度之间显著脱节。语义相似度得分高的模型常常表现出接近零的异常召回率。相比之下,基于视觉的方法展现出最强的事件对齐,异常召回率达 45.7%,持续时长召回率达 100%。这些发现凸显了事件感知评估对确保可靠临床时间序列摘要的重要性。
