论文
医学检查表:通过多模态模型评估医学图像的理解
Medical-Checklist: Assessing the Comprehension of Medical Images by Multimodal Models
摘要
本文介绍了一种新的基准测试 Medical-Checklist,用于评估医疗多模式模型。多模态模型的最新进展已经证明了在医学视觉语言任务领域的巨大潜力。然而,越来越明显的是,评估这些模型的性能,无论是应用于自然图像还是医学图像,都是具有挑战性的。关键问题是模型是否能够准确理解输入图像,同时将其与相关输入文本相关联。为了解决这个问题,Medical-Checklist 对模型进行了二元测试:给它们一张图像和两个图像描述,其中一个是正确的,另一个是错误的,模型必须选择正确的一个。不正确的图像描述包含从正确图像描述中错误替换的单个医学概念(单词或短语)。尽管任务很简单,但这种简单性使得能够对根据不同原理设计和学习的各种多模态模型进行统一评估。它还使我们能够验证模型是否正确理解各个医学子领域的广泛医学概念。 Medical-Checklist 旨在减少数据中的潜在偏差,并能够评估模型处理分布外输入的能力,这在现有数据集中是困难的。当使用 Medical-Checklist 评估四种最先进的医疗多模态模型时,发现尽管它们在 Med-VQA 等特定任务中表现出色,但它们可能无法正确理解图像,这表明临床应用还有很长的路要走。数据集和代码将在接受后公开。