论文

在以前未见过的真实伤口图像上评估医学视觉语言模型 HuluMed 和 MedGemma 以及通用聊天机器人 Gemma 3、ChatGPT Plus 和 Claude Pro

Evaluation of Medical Vision Language Models HuluMed and MedGemma, and general purpose chatbots Gemma 3, ChatGPT Plus, and Claude Pro on real previously unseen wound images

模型评测模型能力评测

摘要

慢性伤口评估仍然是一项具有临床挑战性的任务,需要准确解释伤口形态、组织成分、血管特征和感染风险。视觉语言模型 (VLM) 的最新进展引入了通过图像理解与临床推理相结合进行自动化多模式伤口分析的可能性。本研究使用包含 20 个临床不同伤口的扩展、精选数据集,评估了用于临床伤口评估的几种通用和医学专业开源和专有 VLM 的性能,这些伤口涵盖血管、手术、缺血、静脉、淋巴水肿和截肢相关病因。使用包含伤口分类、感染风险、血管介入建议、清创紧迫性、伤口治疗选择和高级管理规划的结构化十二个问题临床框架对六个 VLM 进行了评估。在 20 个伤口病例和 240 个临床医生分级的伤口分析决策中,ChatGPT 取得了最高的整体表现,正确答案为 174/240 (72.50%),其次是 Claude,正确答案为 149/240 (62.08%)。在开源和医学专业模型中,HuluMed 的表现最为强劲,正确答案为 96/240 (40.00%),其次是 Gemma 3 (81/240, 33.75%)、MedGemma 4B (62/240, 25.83%) 和 MedGemma 27B (42/240, 17.50%)。研究结果表明,前沿通用多模态系统目前表现出比医学专业替代方案更强的伤口分析性能,凸显了广泛的多模态推理能力以及特定领域的医学知识的持续重要性。尽管当前的 VLM 在临床决策支持方面表现出巨大的潜力,但在先进的伤口管理推理、程序规划和自主临床可靠性方面仍然存在很大的局限性。