论文
LocAnyMed:多模态医学图像的视觉语言基础
LocAnyMed: Vision-Language Grounding for Multimodal Medical Images
摘要
医学视觉基础将自由形式的临床查询与医学图像中的空间证据连接起来,是可解释的医学人工智能的重要组成部分。然而,通用基础模型主要在自然图像上进行训练,而现有的医学定位资源在成像模式、数据集和任务制定方面仍然分散。为了解决这一差距,我们构建了 LocAnyMed-200K,这是一个多模态医学视觉基础数据集,包含大约 20 万个涉及计算机断层扫描、光学医学成像、超声和 X 射线的图像查询答案示例。我们将异构检测和定位资源协调为一种统一的自由格式指令格式,该格式支持一个或多个边界框、点坐标和否定查询的无目标输出。 LocAnyMed-200K 上 LocateAnything-3B 的全参数 微调 在保持评估分割上将 F1@IoU 0.50 从 10.64 提高到 85.59,这表明大规模特定领域监督可以为通用视觉定位模型配备有效的医疗定位功能。除了空间坐标之外,临床可解释的视觉定位系统还应该传达支持其预测的证据。因此,我们推导出 LocAnyMed-CoT-20K,这是一个推理依据增强的子集,它通过结构化推理连接解剖背景、视觉观察和空间结论,并通过 微调 进一步改进跨源泛化。这些资源共同为研究跨异构医学成像模式的定位精度和基本原理质量提供了统一的基础。该代码可在 https://github.com/MiliLab/LocAnyMed 上公开获取。