论文
MMBU:大规模多模态生物医学理解基准,用于探索视觉语言模型的感知能力
MMBU: A Massive Multi-modal Biomedical Understanding Benchmark to Probe the Perception Capabilities of Vision-Language Models
摘要
视觉和语言模型 (VLM) 有望改变生物医学成像工作流程,从胸部 X 光中的病变检测到显微镜中的细胞特征分析。然而,实现这种潜力需要强大且细粒度的视觉感知。模型需要正确解释图像中的微妙特征,并且它们必须在不同的生物医学模式、尺度和背景下做到这一点。尽管如此,当前的基准仍然有限。为了解决这些差距,我们引入了大规模多模式生物医学理解(MMBU)基准。它是迄今为止最大的生物医学视觉和语言基准,涵盖 35 个具有丰富结构化元数据的子模态。它包括开放式和封闭式的无依据分类、有依据分类和对象检测,能够跨生物尺度、临床环境和成像模式系统地评估模型性能。在主要比较中评估 16 个开放权重和 5 个前沿 VLM,我们发现虽然医学适应为某些模型提供了可测量的增益,但通常在既定基准上报告的高精度可以掩盖视觉感知和领域泛化方面的缺陷。我们进一步定义了一个开放式的 MMBU 硬集,分为发布的公共子集和保留的私有子集,以对前沿模型进行压力测试。