论文

HERO:用于肿瘤学稳健表示的组织学编码器

HERO: Histology Encoder for Robust Representation in Oncology

模型训练预训练

摘要

在大型病理学图像语料库上训练的基础模型现在为计算病理学提供了强大的、可转移的表示。在过去的几年里,一系列这样的模型已经发布,每个模型都比上一个在更多的幻灯片上进行了训练。在标准分类和细分基准上,领先模型现在差距很小。然而,在临床使用中,基础模型应用于来自医院、扫描仪和训练数据之外的染色协议的图像。编码器通常将这些采集因素与生物信息一起嵌入,这可能会引入下游错误并阻碍安全的临床采用。因此,病理学基础模型应该对采集偏移具有鲁棒性,同时又不放弃表示质量,但鲁棒性很少是模型比较的轴。在本报告中,我们介绍了 HERO(肿瘤学稳健表示的组织学编码器),这是一种 ViT-G/14 病理学基础模型,使用 DINO 和 iBOT 目标进行训练,并通过高分辨率 Gram 锚定在来自约 575,000 个临床全切片图像的 5 亿块形态平衡语料库上进行细化。在评估的公共基准中,HERO 在比较的最先进的基础模型中显示出最强的中心、扫描仪和染色变化鲁棒性,在图块级分类、分割和基因表达预测方面表现相当,在 39 个评估的幻灯片级临床任务中平均排名第一,并且在等权重框架级分析下,在六个基准框架中具有最佳平均排名。