论文

医学图像对齐能否检验前沿多模态模型的通用视觉推理?

Medical Image Alignment Assessment as a Test of Generalist Visual Reasoning in Frontier Multimodal Models

模型评测模型能力评测

摘要

作为通用人工智能探索的一部分,前沿多模态大语言模型 (MLLM) 越来越多地被定位为通用视觉推理机。这种通用性的一个关键测试是,它们是否能够执行人类可以根据视觉证据和任务指令可靠地做出的新颖的视觉判断,而无需针对特定任务的参数优化。我们通过医学图像对齐评估任务来研究这个问题,其目标是确定两个图像之间是否存在解剖学对应性。图像对齐的人类视觉评估仍然是黄金标准和最常见的方法;然而,它需要训练有素的操作员,并且对于大型数据集来说是不切实际的。我们在两个典型的医学图像对齐任务上评估了最近几代 MLLM,改变了提示策略和图像呈现方法。我们与局部微调的 MLLM 和特定于任务的 CNN 进行比较,以检查前沿通用模型和需要特定任务优化但可以在本地使用的较小模型之间的权衡。我们表明,这正在达到一个拐点,前沿 MLLM 现在可以对医学图像对齐进行有效的视觉评估。几个月前发布的模型泛化能力很差,在某些设置下,性能仅高于 随机水平,而 GPT-6 在几乎所有测试场景中都达到了 85% 以上。经过微调的本地模型可以在所训练的任务上匹配或超过前沿模型的性能,但在未见过的设置中迁移的效率要低得多。这些发现将医学图像对齐确定为通用视觉推理的有用测试台,并表明前沿多模态模型开始获得可以支持跨异构医学成像管道的通用质量控制机制的功能。

医学图像对齐能否检验前沿多模态模型的通用视觉推理?:论文原图
图 2:医学图像对准评估方法概述。我们在两个模态对上测试图像对齐评估:跨扫描仪 T1w MRI-PET 和 MRI T1w-FLAIR 对齐。我们强调不同的模态对和图像呈现技术如何影响对齐评估任务。黄色缩放框显示心室错位,这对于 MRI-PET 轮廓和 T1w-FLAIR alpha 混合(黄色实心框)很容易发现,但在 MRI-PET alpha 混合(黄色虚线框)中很难看到。红色变焦框显示大脑边缘未对准,这在 MRI-PET α 混合(红色虚线框)中很容易发现,但在 MRI-PET 轮廓(红色实线框)中很难明确看到。