论文
MVC-Bench:医学视觉语言模型的基准校准
MVC-Bench: Benchmarking Calibration of Medical Vision-Language Models
摘要
视觉语言模型 (VLM) 和医学视觉语言模型 (Medical-VLM) 的可靠评估需要经过校准的置信度,特别是在现实的临床条件下。然而,现有的努力主要集中在提高准确性,而医学领域的校准尚未得到充分探索。为此,我们提出了 MVC-Bench,这是一种以校准为中心的基准,用于使用 VLM 和 Medical-VLM 进行医学图像分类。 MVC-Bench 评估三个轴上的校准:(i) 对模态、主干和域转移的鲁棒性 (ii) 校准策略和提示调整方法的有效性 (iii) 提示模板和随机种子变化下的稳定性。该基准涵盖八种不同的骨干、三种医疗模式,包括域内和域转移设置下的眼底成像、组织病理学和胸部 X 射线。它比较了事后校准、训练时间校准和零样本推理方法,以及六种即时调整方法。在超过 1638 个受控实验中,我们报告精度和预期校准误差 (ECE) 作为主要指标,并进一步报告具有补充校准措施的结果,包括最大校准误差 (MCE) 和自适应校准误差 (ACE)。我们进一步研究了 VLM 和医疗 VLM 中校准错误的根本原因,并提出了一种简单的训练时间校准方法,即多类裕度 (MCM) 正则化,该方法在域内 12 个设置中的 10 个设置中实现了最低 ECE,并且在域转换下保持竞争力。总的来说,MVC-Bench 提供了一个结构化的评估框架和可操作的指导,以改进安全关键型医疗工作流程中的校准。