论文
医学图像对齐能否检验前沿多模态模型的通用视觉推理?
Medical Image Alignment Assessment as a Test of Generalist Visual Reasoning in Frontier Multimodal Models
摘要
作为通用人工智能探索的一部分,前沿多模态大语言模型 (MLLM) 越来越多地被定位为通用视觉推理机。这种通用性的一个关键测试是,它们是否能够执行人类可以根据视觉证据和任务指令可靠地做出的新颖的视觉判断,而无需针对特定任务的参数优化。我们通过医学图像对齐评估任务来研究这个问题,其目标是确定两个图像之间是否存在解剖学对应性。图像对齐的人类视觉评估仍然是黄金标准和最常见的方法;然而,它需要训练有素的操作员,并且对于大型数据集来说是不切实际的。我们在两个典型的医学图像对齐任务上评估了最近几代 MLLM,改变了提示策略和图像呈现方法。我们与局部微调的 MLLM 和特定于任务的 CNN 进行比较,以检查前沿通用模型和需要特定任务优化但可以在本地使用的较小模型之间的权衡。我们表明,这正在达到一个拐点,前沿 MLLM 现在可以对医学图像对齐进行有效的视觉评估。几个月前发布的模型泛化能力很差,在某些设置下,性能仅高于 随机水平,而 GPT-6 在几乎所有测试场景中都达到了 85% 以上。经过微调的本地模型可以在所训练的任务上匹配或超过前沿模型的性能,但在未见过的设置中迁移的效率要低得多。这些发现将医学图像对齐确定为通用视觉推理的有用测试台,并表明前沿多模态模型开始获得可以支持跨异构医学成像管道的通用质量控制机制的功能。
