论文

Lost in Volume:用于评估 3D 医学视觉语言模型的语义空间理解的 CT-SpatialVQA 基准

Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models

模型评测基准与评测资源

摘要

3D 医学视觉语言模型的最新进展使得能够对体积图像和文本进行联合推理,在医学视觉问答 (VQA) 和报告生成方面显示出强大的性能。尽管取得了这些进展,但仍不清楚这些模型是从 3D 体积中学习基于空间的解剖学,还是主要依赖于学习的先验和语言相关性。这种不确定性源于缺乏对体积医学 VLM 中语义空间推理的系统评估,以提供临床可靠的决策支持。为了解决这一差距,我们引入了 CT-SpatialVQA,这是一个旨在评估 3D CT 数据中的语义空间推理的基准。该基准包括直接源自 1601 份放射学报告和 CT 卷的 9077 个临床基础问答 (QA) 对,这些问答通过强大的 LLM 辅助管道进行验证,人类一致同意率达 95%。我们的数据集需要明确的解剖定位、侧向意识、结构比较和 3D 结构间关系推理。我们还引入了标准化评估协议并对 8 个 3D 医学 VLM 进行了基准测试,发现语义空间推理任务严重退化,平均准确度为 34%,并且通常低于随机,强调需要更深入地整合体积证据以实现值得信赖的临床使用。