论文

SAM 遇见 VLM:用于统一医学推理和分割的参数解耦全参数训练

SAM Meets VLM: Parameter-Decoupled Full-Parameter Training for Unified Medical Reasoning and Segmentation

模型训练监督微调与指令调优

摘要

人们越来越期望医学多模态大语言模型 (MLLM) 不仅能够回答临床问题,还能定位其预测背后的视觉证据。一种常见的策略是通过特殊的 <SEG> 标记将视觉语言模型 (VLM) 与 SAM 式分割连接起来,但这种统一架构的全参数训练很困难,因为图像级推理和像素级分割对共享表示空间提出了不同的要求。为了解决这个问题,我们提出了一个用于统一医学推理和分割的参数解耦训练框架。该框架将 <SEG> 隐藏状态视为掩码解码器的语义到空间提示,并鼓励其与通用语言状态分离,从而减少不明确的分割提示和对推理表示的潜在破坏。它首先进行医学浅层对齐,使视觉特征适应临床语言,而不干扰大语言模型;然后控制指令调整形状可分离的 <SEG> 提示状态,由 Davies-Bouldin Index (DBI) 监控,同时缩放进入语言主干的分段梯度;最后,SAM 分支专门用于冻结 VLM,以在不改变推理参数的情况下提高掩模精度。医学参考分割、基础、视觉 QA 和文本 QA 基准的实验表明,我们的框架实现了强大的语言条件分割,同时保留了竞争性推理能力。消融表明,两阶段指令调整、梯度缩放和分段专门化都对模型有贡献。