论文

LoMeVQA:纵向医学 VQA 的综合基准

LoMeVQA: A Comprehensive Benchmark for Longitudinal Medical VQA

模型评测基准与评测资源

摘要

在临床实践中,患者经常在连续就诊中接受多次影像学检查,产生纵向数据。对此类时间信息进行建模对于可靠评估疾病进展和治疗反应至关重要。然而,尽管多模态 大语言模型 (MLLM) 取得了快速进展,但纵向医学视觉推理在很大程度上仍未得到充分探索。为了填补这一空白,我们提出了 LoMeVQA,这是一个由 206K 纵向视觉问答 (VQA) 对组成的综合基准,用于时间医学图像分析。 LoMeVQA涵盖五个任务:病情进展分类、病情进展描述、病情进展报告生成、差异区域定位和差异区域描述。为了构建数据集,我们开发了一个自动化管道,(1)按时间顺序组织患者记录,(2)通过医学知识图提取有临床意义的实体,(3)对其时间演化进行建模,以指导 大语言模型 生成高质量的纵向 VQA 对。广泛的评估表明,通用和医疗领域 MLLM 在 LoMeVQA 上的表现都很差,揭示了时间推理的巨大局限性。为了解决这些限制,我们推出了 MedLong-8B,它在所有任务中都实现了最先进的性能。除了基准测试之外,我们还进行详细的分析,揭示关键的故障模式,并阐明如何改进纵向医学视觉推理。我们的数据可在以下网址获取:https://github.com/pepperbubble/LoMeVQA