论文
MedUP:唤醒医学视觉语言模型中的统一理解和感知
MedUP: Awakening Unified Understanding and Perception in Medical Vision-Language Models
摘要
医学视觉语言模型 (Med-VLM) 擅长用语言表达视觉内容,但精确的视觉感知、分割和基础仍然具有挑战性。现有的方法要么将区域描述为坐标字符串,要么依赖外部模块将感知与理解分离,从而为区域语言对齐创造表示间隙。我们推出了 MedUP,一种 Med-VLM,它在共享词元空间中原生地统一了感知和理解。其核心在于 UniMedTok,这是一个区域标记器,可将掩模编码为 LLM 词汇表中的离散标记,使模型能够将掩模标记与文本无缝交错。我们策划了 UniMed-Train,这是一个 184 万个实例的语料库,涵盖文本引导分割、基于区域的理解、医学 VQA 和基于 CoT 的分割,并引入 UniMed-Bench 进行统一评估。大量实验表明,MedUP 在所有任务上都优于本机、代理和双解码器 Med-VLM,同时与专业分割器保持竞争力,展示了统一理解和感知建模的强大潜力。