论文
增强医疗多模式中的 3D 空间推理 大语言模型
Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models
摘要
虽然多模态 大语言模型 (MLLM) 在 2D 医学图像理解方面取得了显着的成功,但其向 3D 体积成像的扩展仍然受到高昂的注释成本和数据集不透明度的阻碍。当前的数据格式主要由严格的视觉问答(VQA)对或非结构化的最终临床报告组成,通常无法捕获明确的临床推理。为了解决这个限制,我们引入了通过新颖的切片数据合成范例构建的大规模结构化推理数据集。受放射科医生真正的诊断工作流程的启发,该范式通过分解复杂的 3D 读取过程来模拟视觉认知,将全局临床先验转化为细粒度的每切片观察结果,随后将其合成为可解释的思想链 (CoT)。至关重要的是,这种综合推理框架强制执行基本的临床原则:顺序空间跟踪、用于伪影缓解的多切片空间感知以及差异排除。为了验证这种方法,我们使用合成数据对标准 2D 预训练 MLLM 基线进行指令调整,以增强其体积理解。跨多个 3D 医学基准的综合评估表明,我们的方法比 2D 基准具有显着的性能改进。此外,生成的模型表现出强大的空间推理能力,可与资源密集型原生 3D 架构相媲美,有效缩小性能差距。最终,这种以数据为中心的策略解锁了深入的体积理解和高度可解释的临床逻辑,而不需要计算昂贵的 3D 特定 预训练。完整的存储库(包括数据集和训练工作流程)可在 https://github.com/2020420145009/hounsfield 上公开获取。