论文

NeuroVLM-Bench:评估视觉 大语言模型 在神经系统疾病临床推理中的应用

NeuroVLM-Bench: Evaluation of Vision-Enabled Large Language Models for Clinical Reasoning in Neurological Disorders

模型评测基准与评测资源

摘要

多模态 大语言模型 的最新进展为基于图像的决策支持带来了新的可能性。然而,它们在神经影像学中的可靠性和操作权衡仍然没有得到充分理解。我们使用涵盖多发性硬化症、中风、脑肿瘤、其他异常和正常对照的精选 MRI 和 CT 数据集,对支持视觉的 大语言模型 进行 2D 神经成像的全面基准研究。模型需要同时生成多个输出,包括诊断、诊断亚型、成像模式、专门序列和解剖平面。性能从四个方向进行评估:带有弃权的判别分类、校准、结构化输出有效性和计算效率。多阶段框架确保公平比较,同时控制选择偏差。在二十个前沿多模态模型中,结果表明,模态和平面等技术成像属性几乎已得到解决,而诊断推理,尤其是亚型预测,仍然具有挑战性。肿瘤分类成为最可靠的任务,中风是可以适度解决的,而多发性硬化症和罕见异常仍然很困难。少量提示可提高多种模型的性能,但会增加词元使用、延迟和成本。 Gemini-2.5-Pro 和 GPT-5-Chat 实现了最强的整体诊断性能,而 Gemini-2.5-Flash 提供了最佳的效率与性能权衡。在开放权重架构中,MedGemma-1.5-4B 展示了最有希望的结果,因为在少样本提示下,它接近多个专有模型的零样本性能,同时保持完美的结构化输出。这些发现为性能、可靠性和效率权衡提供了实用的见解,支持神经影像学中多模态 LLM 的标准化评估。