论文
DeepTumorVQA:用于医学 VLM 和工具增强代理的分阶段评估的分层 3D CT 基准
DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents
摘要
医学视觉语言模型 (VLM) 和人工智能代理在学习分析和推理临床图像方面取得了重大进展。然而,现有的医学视觉问答 (VQA) 基准将模型功能压缩为单个准确度分数,从而掩盖了模型失败的位置和原因。我们提出了 DeepTumorVQA,这是一个分层基准,遵循肿瘤诊断中的多阶段证据链,并将 3D CT 推理分解为四个阶段:识别、测量、视觉推理和医学推理。较高级别的问题仍然可以独立评分,而其 真值 证据链是在较低级别的原语上定义的。该基准包含 9,262 个 3D CT 卷上的 42 个临床亚型的 476,000 个问题。除了VLM的直接推理模式外,DeepTumorVQA还为代理评估提供了工具交互环境,模型可以在回答问题之前调用外部工具,包括分割模型、测量程序和医学知识模块。通过评估 30 多种模型配置,我们发现可靠的定量测量是主要瓶颈,使 VLM 的后期视觉和医学推理变得更加困难,而工具增强则大大缓解了这个问题。当工具可用时,利用医学知识和工具来推理医学图像成为一个新的挑战。我们进一步表明,来自 DeepTumorVQA 的 真值 逐步工具使用跟踪可以监督代理并减少工具使用和推理失败。这种从识别到测量再到视觉和医学推理的阶段性进展为未来的医学 VLM 和 AI 代理研究提供了具体的路线图。所有数据和代码均发布于 https://github.com/Schuture/DeepTumorVQA。