论文
MMRareBench:罕见疾病多模态和多图像医学基准
MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark
摘要
多模态 大语言模型 (MLLM) 具有针对常见疾病的高级临床任务,但其在罕见疾病方面的表现在很大程度上尚未经过测试。在罕见疾病情况下,临床医生往往缺乏事先的临床知识,迫使他们严格依赖病例级证据进行临床判断。现有的基准主要评估常见条件、单图像设置,而在罕见疾病数据稀缺的情况下对多模态和多图像证据的整合没有系统地进行评估。我们推出了 MMRareBench,据我们所知,这是第一个罕见疾病基准,联合评估跨四个工作流程一致轨道的多模式和多图像临床能力:诊断、治疗计划、跨图像证据对齐和检查建议。该基准包括 1,756 个问答对以及从 PMC 病例报告中精选的 7,958 个相关医学图像,具有 Orphanet 锚定本体对齐、特定轨道泄漏控制、基于证据的注释和两级评估协议。对 23 个 MLLM 的系统评估揭示了分散的能力概况和普遍较低的治疗计划性能,尽管诊断分数具有竞争力,但医疗领域模型在多图像轨道上大幅落后于通用 MLLM。这些模式与容量稀释效应一致:医学 微调 可以缩小诊断差距,但可能会削弱罕见疾病证据集成所需的组合多图像能力。