论文
迷失在炒作中:揭示和剖析医疗多模态 大语言模型 在图像分类中的性能下降
Lost in the Hype: Revealing and Dissecting the Performance Degradation of Medical Multimodal Large Language Models in Image Classification
摘要
多模态 大语言模型 (MLLM) 的兴起引发了医学成像分析领域前所未有的应用浪潮。然而,作为最早、最基本的任务之一,医学图像分类揭示了一个令人警醒的现实:与传统深度学习模型相比,最先进的医学 MLLM 始终表现不佳,尽管它们在 预训练 数据和模型参数方面具有压倒性优势。这个悖论促使我们进行批判性的反思:性能下降到底源于何处?在本文中,我们对三个代表性图像分类数据集的 14 个开源医学 MLLM 进行了广泛的实验。超越表面的性能基准测试,我们采用特征探测来跟踪整个 MLLM 管道中逐模块、逐层的视觉特征信息流,从而实现分类信号在何处以及如何被扭曲、稀释或覆盖的明确可视化。作为剖析医学 MLLM 中分类性能退化的首次尝试,我们的研究结果揭示了四种故障模式:1)视觉表示的质量限制,2)连接器投影的保真度损失,3)LLM 推理的理解缺陷,以及 4)语义映射的错位。同时,我们引入了表征特征演化健康状况的定量分数,从而能够在不同的 MLLM 和数据集之间进行原则性比较。此外,我们还围绕阻碍当前医学 MLLM 发挥其临床潜力的关键障碍提供了富有洞察力的讨论。我们希望我们的工作能够引发社区内部的重新思考,强调从高期望到可临床部署 MLLM 的道路仍然漫长而曲折。