论文

MedPixel:用于医学推理和分割的统一像素语言模型

MedPixel: A Unified Pixel-Language Model for Medical Reasoning and Segmentation

模型训练偏好优化

摘要

可靠的医学图像理解需要模型将临床语言和视觉推理与像素级基础联系起来。然而,医学视觉语言模型通常缺乏精确的定位,而医学分割器通常依赖于明确的目标类别或精确的空间提示。这种分歧因监督不匹配而加剧:分割数据集提供精确的掩模,但很少有语言监督,而医学视觉语言数据很少将语言与密集的空间注释配对。为了解决这一差距,我们提出了 MedPixel,这是一个围绕共享语言-掩模接口构建的统一医学像素语言模型。为了提供可扩展的监督,我们引入了 MedPLG-440K,包括通过临床驱动的合成过程构建的大约 440K 像素语言任务样本,无需外部 LLM 注释。 MedPixel 采用联合多任务监督 微调 进行训练,然后进行像素级偏好优化,该优化使用 真值 掩模作为离线验证器,从掩模质量中得出响应偏好。 MedPixel 支持广泛的任务,涵盖显式基础、隐式推理、空间交互、基础解释和医学 VQA。在整个任务范围内,MedPixel 在像素级预测和响应生成方面都实现了强大的性能,同时还具有到外部视觉定位基准的有效零样本传输以及对不完美空间提示的鲁棒性。代码和模型检查点将在 https://github.com/yhy-whu/Medpixel 发布。