论文
公共医学视觉语言基准中训练前污染的受控审计
A Controlled Audit of Pretraining Contamination in Public Medical Vision-Language Benchmarks
摘要
医学视觉语言模型(VLM)是根据公共基准进行评估的,这些基准的图像和问答对多年来一直可以免费下载,但报告的准确性假设这些示例在预训练中不存在。我们使用四个检测器系列审核 SLAKE-En、PathVQA、VQA-RAD 和辅助公共 OmniMedVQA 镜像上的开放 VLM:针对 PMC-OA-beta 的图像侧近邻重叠、规范顺序可交换性、队列相对 Min-K%++ 尾部富集和跨模型 top-K 重叠。我们发现 SLAKE-En 上可测量的图像侧源重叠:19.8% 的图像在 SigLIP-B-16 下标记,4.2% 在 SigLIP-SO400M 下标记,而域外控件产生 0/2000 标记。手动裁决显示与不同患者的相同模态、相同投影匹配,而不是经过验证的像素级重复,因此我们将其解释为源或分布重叠,而不是确认的每个图像记忆。在文本方面,SLAKE-En 上的 Qwen2.5-VL 显示了规范顺序可交换性信号,该信号在顺序消融和外部非医学基线中仍然存在。在 OmniMedVQA 镜像上,五个医疗和通用 VLM 的可交换性触发,而 BLIP-2 保持干净。相比之下,队列相对 Min-K%++ 尾部富集和跨模型 top-K 重叠在外部前域基线下崩溃:尽管缺乏合理的医学 VQA 暴露,BLIP-2 仍再现了明显的阳性信号。我们的结论是,这些队列相关检测器作为小型医学 VLM 队列上的独立成员推理信号是不可靠的。