视觉语言模型作为组织病理学中的零注释预言
Vision-Language Models as Zero-Annotation Oracles in Histopathology
摘要
前景分割是每个计算病理学流程的关键第一步,但现有方法依赖于手动调整的启发式或监督模型,这些模型过度适应狭窄的染色和扫描仪分布,在特殊染色(例如 Jones silver 或 Elastica van Gieson)上默默失败。我们提出了一种从粗到细的方法,将前景分割重新定义为视觉感知任务,并利用通用视觉语言模型(VLM)作为零注释预言机。我们的主要见解是,组织与背景的辨别是一个自然图像识别问题,而不是组织病理学问题,因此在互联网规模的语料库上训练的 VLM 可以概括特定领域模型无法概括的领域。我们推出 Leica-75,它是涵盖三个染色系列的 75 张肾移植全幻灯片图像的基准。在 Leica-75 上,我们的方法在分布外染色上实现了最高的分割质量(Jones 上的 Dice 0.858 +/- 0.027,EVG 上的 0.853 +/- 0.041),交叉染色方差比最佳监督基线低 7 倍,同时在分布内 H&E 上保持竞争力。使用自动策划的范例(自动上下文)进行少量提示可以挽救 Stress-32 (n=32) 上的困难情况,Stress-32 是策划的压力测试子集(2B 模型的 Dice 0.470 到 0.819)。基于 VLM 的注释审查符合人类专家共识(对于模糊检测,kappa=0.989;对于分割掩模审查,平均精确度/召回率分级准确度为 0.708,而人类为 0.646)。生成的伪标签用于提取轻量级学生模型,这些模型的性能与教师模型相同,而运行成本仅为教师模型的一小部分。我们的框架为数字病理学中持续存在的基础设施瓶颈提供了原则性的、可扩展的解决方案。