论文

MetaStructAtlas:全身 PET/CT 功能和结构推理的基础 3D 视觉语言数据集和基准

MetaStructAtlas: A Grounded 3D Vision-Language Dataset and Benchmark for Functional and Structural Reasoning in Whole-Body PET/CT

模型评测基准与评测资源

摘要

代谢功能和解剖结构的联合解释对于全身PET/CT的临床诊断至关重要。尽管 3D 医学视觉语言模型的最新进展已经取得了显着进展,但目前的努力仅限于局部 CT 成像,在全面的全身 PET/CT 分析方面留下了严重的空白。在这项工作中,我们介绍了 MetaStructAtlas,这是一个用于基础全身 PET/CT 解释的大型数据集,它综合了具有集成解剖、代谢和语义注释的多模态成像。 MetaStructAtlas 提供 490 个联合配准的 3D PET 和 CT 体积以及 50,470 个器官级分割掩模和与图像证据对齐的放射学报告。为了促进交互式推理,我们进一步开发了 MetaStructVQA,这是一个标准化的 3D 基础视觉问答基准,包含 100,565 个 QA 对。该框架明确地将诊断查询与跨模式的视觉证据联系起来,包括解剖学、形态学和代谢特征。最后,我们在 MetaStructVQA 上评估最先进的 3D 医学 VLM,为核医学中的多模态表示学习和集成全身推理奠定了坚实的基础。