论文

病理视觉语言模型真的能看到病理吗?

Do Pathology Vision-Language Models Truly See Pathology?

模型评测基准与评测资源

摘要

病理视觉语言模型 (VLM) 最近发展迅速,通常通过病理 VQA 基准的答案准确性进行评估。然而,我们深入研究了当前的评估并发现了三个被忽视的问题:1)视觉证据并不总是必要的。例如,Gemini-3-Pro 在 5 个 VQA 基准测试中无需任何视觉输入即可实现 53.5% 的平均准确度。 2)领域训练可以提高准确性,而无需视觉绑定的比例增益。与 Qwen2.5-VL-7B 相比,Patho-R1-7B 的多模态增益降低了 5.8 点,注意力 IoU 降低了 3.7 点。 3)实体级注意力是分散的并且查询特定性较弱。在 PathVG 上,注意力图在不同实体查询之间保持高度相关。这些问题可能导致对病理 VLM 的实际多模态能力的严重误判。为此,我们提出了 PathBind,一个包含 2,600 个样本的基准:PathBind-VQA 包含六个维度的 1,500 个问题,PathBind-PTA 包含来自私人病理学教学图集的 600 个问题,PathBind-Grounding 包含 500 个专家策划的区域级样本。每个组件都经过特定于任务的自动过滤和专家审查,以减少文本快捷方式并改善实体区域对应关系。我们在 PathBind 的 VQA 样本和五个现有病理学 VQA 基准上评估了 18 个代表性 VLM,并进一步在 PathBind-Grounding 和 PathVG 上评估了 10 个 VLM。结果表明,当前的病理 VLM 在答案端性能和视觉语义结合之间仍然存在很大差距。