论文
RadSight:迈向感知可靠的多模态放射学图像理解
RadSight: Towards Perceptually Reliable Multimodal Radiology Image Understanding
摘要
人们越来越期望医疗多模态 大语言模型 (MLLM) 执行复杂的图像理解任务,但其可靠性往往因视觉解释中的频繁错误而受到损害。为了系统地追踪这些失败,我们遍历了从高级临床任务到基本视觉感知的层次结构。因此,我们引入了 Perception-Bench,这是一个包含 113 万个样本的大规模基准,可跨六个维度评估医学 MLLM:属性判断、空间基础、空间理解、疾病预测、异常检测和报告生成,涵盖 2D 和 3D 放射图像。我们对 Perception-Bench 的分析表明,现有的 MLLM 甚至无法捕获最基本的病变属性,例如位置、大小和密度。这种无法将临床输出基于主要视觉证据的情况表明,模型的诊断不可靠性根源于低水平视觉感知中一个关键但被忽视的瓶颈。受此启发,我们提出了 RadSight,这是一种基于双 2D/3D 编码器架构构建的感知驱动的 MLLM,可保留本机成像空间结构。 RadSight 将医学图像理解制定为一个四个阶段的渐进过程:视觉语言对齐、细粒度视觉感知、临床诊断和诊断解释。该模型使用渐进式课程学习在 837 万个感知导向的语料库上进行训练。在 Perception-Bench 上,RadSight 在所有六个评估维度上始终优于现有的 MLLM,尤其是在空间基础和临床诊断方面取得了显着的进步。它还在公共 2D 和 3D 医学基准上实现了持续改进,进一步证明强大的底层视觉感知是可靠临床理解的关键基础。代码和模型将公开。