论文
MedRCube:用于医学成像中 MLLM 细粒度和深入评估的多维框架
MedRCube: A Multidimensional Framework for Fine-Grained and In-Depth Evaluation of MLLMs in Medical Imaging
摘要
多模态 大语言模型 (MLLM) 在医学成像领域的潜力提出了与现实世界医学成像实践相一致的系统且严格的评估框架的需求。报告单一或粗粒度指标的现有实践缺乏专业临床支持所需的粒度,并且无法评估推理机制的可靠性。为了解决这个问题,我们提出了向多维度、细粒度和深入评估的范式转变。基于为此范例设计的两阶段系统构建流程,我们使用 MedRCube 对其进行实例化。我们对 33 个 MLLM 进行了基准测试,\textit{Lingshu-32B} 实现了顶级性能。至关重要的是,MedRCube 揭示了一系列在先前评估设置下无法获得的明显见解。此外,我们引入了可信度评估子集来量化推理可信度,发现捷径行为和诊断任务绩效之间存在高度显着的正相关性,引起了对临床可信部署的担忧。这项工作的资源可以在 https://github.com/F1mc/MedRCube 找到。