论文

超越单帧:跨三维 MRI 的多帧空间定位推理

Beyond a Single Frame: Multi-Frame Spatially Grounded Reasoning Across Volumetric MRI

模型评测基准与评测资源

摘要

空间推理和视觉基础是视觉语言模型 (VLM) 的核心功能,但大多数医学 VLM 生成的预测没有透明的推理或空间证据。现有基准还评估孤立 2D 图像上的 VLM,忽略了临床成像的体积性质,其中结果可能跨越多个帧或仅出现在几个切片上。我们推出了空间定位 MRI 视觉问答 (SGMRI-VQA),这是一个针对三维 MRI 进行多帧、空间定位推理的 41,307 对基准。每个 QA 对均根据大脑和膝盖研究的 fastMRI+ 数据集中的专家放射科医生注释构建,包含与临床医生对齐的思想链跟踪和帧索引边界框坐标。任务按检测、定位、计数/分类和字幕的层次结构进行组织,要求模型共同推理存在什么、在哪里以及它延伸到哪些帧。我们对 10 个 VLM 进行了基准测试,结果表明,带有边界框监督的 Qwen3-VL-8B 的监督 微调 持续提高了强零样本基线的空间定位表现,这表明有针对性的空间监督是实现有空间证据支撑的临床推理的有效途径。