论文
多图像的医学思维
Medical thinking with multiple images
摘要
大语言模型 在许多医学 QA 基准上表现良好,但真正的临床推理通常需要整合多个图像的证据,而不是解释单个视图。我们引入了 MedThinkVQA,这是一个专家注释的多图像思维基准,其中模型必须解释每个图像,结合跨视图证据,并通过中间监督和步骤级评估回答诊断问题。该数据集包含 8,067 个案例,其中包括 720 个测试案例,平均每个案例有 6.62 张图像,比之前的工作密集得多,之前的专家级基准测试每个案例最多使用 1.43 张图像。在测试集上,最好的闭源模型Claude-4.6-Opus、Gemini-3-Pro和GPT-5.2-xhigh的准确率仅达到57.2%、55.3%和54.9%,而GPT-5-mini和GPT-5-nano达到39.7%和30.8%。强大的开源模型落后,其中 Qwen3.5-397B-A17B 占 52.2%,Qwen3.5-27B 占 50.6%。进一步的分析表明,基于多图像推理是主要瓶颈:在更高级别的推理发挥作用之前,模型通常无法跨视图提取、对齐和组合证据。提供专业的单图像提示和跨图像摘要可以提高性能,而用自行生成的中间体替换它们会降低准确性。步骤级分析表明,超过 70% 的错误源自图像读取和跨视图集成。缩放结果进一步表明,仅当视觉基础已经可靠时,额外的推理时间计算才有帮助。当早期证据提取较弱时,较长的推理会产生有限或不稳定的收益,并可能放大误读线索。这些结果表明,关键的挑战不仅仅是推理长度,而是在现实世界的多模式临床输入中建立、调整和组合分布式证据的可靠机制。