论文

医学视觉语言模型编辑的评估与理解

Evaluating and Understanding Model Editing for Medical Vision Language Models

模型评测基准与评测资源

摘要

模型编辑有望以快速、定向的方式纠正医学视觉语言模型(VLM)部署后的错误而无需昂贵重训。但既有多模态编辑基准聚焦通用任务、不反映临床领域要求与变异。为此我们引入M3Bench:以临床需求为依据的多模态模型编辑基准——评估编辑在图像与文本变异、模态与协议偏移、临床知识组合与时间进展的挑战下是否保持可靠、精确与可泛化。M3Bench含跨多样解剖、模态与专科的16,276个问题,支持单次与序贯编辑。跨6个医学与通用VLM评估4个代表性编辑器:没有任何方法在所有标准上出色。基于梯度的编辑器迁移强但苦于灾难性局部性违规;基于记忆的方法保持局部性却缺组合泛化,并呈现高的骨干依赖超参敏感。我们进一步把这些失败归因于VLM的潜空间几何及不同编辑方法对其地貌的改变。M3Bench确立多模态模型编辑的严格临床压力测试,为更安全的部署后适配提供可操作指导。

医学视觉语言模型编辑的评估与理解:论文配图
a b 图 1:部署后工作流程和模型编辑性能。 (a) 具有临床医生在环反馈的多模态模型编辑的部署后工作流程。左:具有广泛模型训练的模型开发阶段。右图:模型部署阶段,通过轻量级和有针对性的模型编辑来即时纠正错误。 (b) 编辑性能雷达(顺序编辑),总结 LLaVA-Med-v1.5-Mistral-7b 的 M3​Bench\text{M}^{3}\text{Bench} 评估维度的性能。