论文

用于评估 3D 医学成像视觉语言模型的自动化报告衍生肿瘤学 VQA 基准

Automated Report-Derived Oncology VQA Benchmark for Evaluating Vision-Language Models on 3D Medical Imaging

模型评测基准与评测资源

摘要

评估医学图像上的视觉语言模型 (VLM) 需要基于临床、可扩展且可控制评估混淆的基准。现有的公共基准规模有限,需要手动注释,或者可能会泄露到 VLM 预训练语料库中。我们提出了一个自动化代理驱动的管道,直接从配对的私人放射学报告和 3D 肿瘤学成像生成多选 VQA 数据集,产生两种互补的问题类型:从临床医生定义的报告模式确定性派生的 RADS 式问题,以及由 LLM 根据放射科医生的发现生成并根据源报告进行验证的放射学报告派生问题。该管道应用于四个内部癌症队列,产生实例污染控制的基准,无需针对每个问题进行人工注释。对六个 VLM 的零样本评估揭示了所有单元中没有主导模型和大量的空间。盲消融表明,视觉依赖是高度数据集特定的:肝脏报告衍生的问题确实需要图像,而肺部 CT 基本上可以在没有图像的情况下解决 - 领先的封闭模型超过了盲法时肺部 CT 的视觉准确性 - 表明即使是私人临床数据也不能保证视觉能力的污染控制读取。该管道作为开放代理技能发布,用于内部重新部署。