论文

审计全幻灯片图像多模态基准中的数据泄漏

Auditing Data Leakage in Whole-Slide Image Multimodal Benchmarks

模型评测评测方法与指标

摘要

最近用于计算病理学的视觉语言模型(VLM)在全幻灯片图像(WSI)视觉问答(VQA)基准上报告了惊人的零样本性能。我们审核这些声明,发现它们从根本上受到两个层次级别的数据泄漏的影响:患者级别的泄漏,来自同一病例的幻灯片同时出现在训练和测试折叠中;以及机构级别的泄漏,其中不同的病例通过共同的组织源站点(TSS)共享染色批次和扫描仪签名。通过追踪主要公共资源中的规范幻灯片、案例和 TSS 标识符,我们记录了在 TCGA 派生的基准上 92.3~100% 的案例级训练测试重叠,以及接近完整的 TSS 重叠。我们进一步证明,这两种泄漏水平都可以从基础模型特征空间线性解码,它们在已发布的检查点上的泄漏案例和审计干净案例之间产生可测量的精度差距,并且在多个已发布的 WSI VLM 中,报告的峰值精度集中在污染最严重的基准上。因此,当前的 WSI VQA 评估无法区分真正的多模态推理和对记忆的机构和患者特定工件的最近邻检索。最后,我们概述了无污染评估的具体建议。通过解决基准构建、出处披露和自动重叠审计问题,我们的目标是引导未来的研究走向可验证的进展主张。