EviPathBench:全玻片病理学视觉语言模型中证据获取和推理的基准测试
EviPathBench: Benchmarking Evidence Acquisition and Reasoning in Vision-Language Models for Whole-Slide Pathology
摘要
全幻灯片图像 (WSI) 诊断需要识别诊断相关区域,通过放大倍数检查它们,并整合多尺度证据。然而,大多数病理学基准测试都是在预先裁剪的补丁或预先提取的幻灯片特征上评估模型,从而使它们从十亿像素 WSI 中获取证据的能力基本上未经测试。我们推出了 EviPathBench,这是一个评估全玻片病理学视觉语言模型 (VLM) 证据获取和推理的基准。它评估四种能力:用于证据解释的图像到文本匹配、用于证据验证的文本到图像检索、用于证据获取的诊断区域定位以及用于证据集成的多尺度推理。该基准被组织为诊断树,将不同放大倍率的嵌套区域与特定尺度的发现和路径级诊断连接起来。它包含 1,822 个 TCGA WSI 和 17,135 个诊断路径,由 10 名委员会认证的病理学家注释。由 190 个乳腺癌 WSI 组成的私人队列(带有详细注释)进一步评估了自主全幻灯片探索。我们评估了 19 个涵盖通用、医学和病理学专业系列的 VLM,以及一个纯文本参考模型。领先的开放权重模型在多尺度推理中的准确率超过 93%,在跨模态匹配任务中的准确率超过 50%。相比之下,诊断区域定位仍然具有挑战性:最佳文本引导的平均交集低于 0.09,表现不佳基于中心的启发式。自主探索时,无条件命中率从低倍率的0.522下降到中倍率的0.185和高倍率的0.020。这些结果揭示了根据策划的证据进行推理与从 WSI 中获取证据之间存在明显的差距。 EviPathBench 提供了一个统一的框架来衡量和改进这两种功能。