论文
医学视觉语言模型编辑的评估与理解
Evaluating and Understanding Model Editing for Medical Vision Language Models
摘要
模型编辑有望以快速、定向的方式纠正医学视觉语言模型(VLM)部署后的错误而无需昂贵重训。但既有多模态编辑基准聚焦通用任务、不反映临床领域要求与变异。为此我们引入M3Bench:以临床需求为依据的多模态模型编辑基准——评估编辑在图像与文本变异、模态与协议偏移、临床知识组合与时间进展的挑战下是否保持可靠、精确与可泛化。M3Bench含跨多样解剖、模态与专科的16,276个问题,支持单次与序贯编辑。跨6个医学与通用VLM评估4个代表性编辑器:没有任何方法在所有标准上出色。基于梯度的编辑器迁移强但苦于灾难性局部性违规;基于记忆的方法保持局部性却缺组合泛化,并呈现高的骨干依赖超参敏感。我们进一步把这些失败归因于VLM的潜空间几何及不同编辑方法对其地貌的改变。M3Bench确立多模态模型编辑的严格临床压力测试,为更安全的部署后适配提供可操作指导。
