论文
使用面向临床医生的社交媒体进行医学图像识别的视觉大语言基础模型
A visual large language foundational model for medical image recognition using clinician-oriented social media
摘要
大语言模型(LLM)在不同领域表现出了强大的能力,在医学领域显示出巨大的潜力。然而,它们在医疗环境中的应用仍然受到缺乏捕获临床推理和明确的图像文本对齐的视觉问答(VQA)数据集的限制。在这里,我们利用在面向临床医生的社交媒体上分享的去识别化医学图像和专家评论。通过将先进的大语言模型与临床医生在环验证相结合,我们建立了严格的管道来构建 ThoughtMed-1M,这是一个包含超过一百万对 VQA 的长格式医学 VQA 数据集,旨在捕获结构化临床逻辑和医学图像文本对齐。为了展示其实用性,我们开发了基于 ThoughtMed-1M 训练的基础大语言模型 (FOLTMed)。 FOLTMed 在 42 个医学 VQA 基准数据集上实现了最先进的性能,宏观准确率为 85.4%,并在 ThoughtMed-1M 测试集上生成了更多临床一致的响应。它在事实性和相似性指标方面比最先进的模型高出 3--5%,凸显了推进基于临床的多模态大语言模型研究的可扩展范式。