论文

UCSF-PDGM-VQA:用于脑肿瘤 MRI 解释的视觉问答数据集

UCSF-PDGM-VQA: Visual Question Answering dataset for brain tumor MRI interpretation

模型评测基准与评测资源

摘要

脑肿瘤的诊断在很大程度上取决于磁共振成像 (MRI) 评估,这需要放射科医生在多个 3D 序列和纵向研究中合成数千张图像。这个过程需要先进的神经放射学训练,造成大量的认知负担,并且非常耗时。尽管放射学的需求不断增加,但这种专业知识很难扩展,给当前的卫生系统带来了压力。视觉语言模型 (VLM) 通过对复杂的大脑 MRI 进行半自动、交互式解释,提供了减轻这种负担的机会。然而,由于缺乏评估它们的专门基准,它们目前在神经肿瘤学中没有得到充分利用。我们引入了临床相关的视觉问答 (VQA) 基准——UCSF-PDGM-VQA 数据集——由来自公共 UCSF-PDGM 数据集中 473 项神经胶质瘤相关 MRI 研究的 2,387 个 QA 对组成。我们进一步在此数据集上为六种最先进的视觉语言模型(VLM)和一个 大语言模型 建立了性能基线。我们发现当前模型无法有效处理多序列、3维MRI扫描,从而导致视觉特征的抑制和对语言先验的过度依赖,导致模态崩溃。这些发现强调了临床环境中当前模型可靠性和安全性的严重缺陷,需要开发强大的、特定领域的 VLM。