论文
DINOv3-MIL:基于 KiTS23 上的基础模型补丁词元进行每个肾脏多标签肿瘤和囊肿检测
DINOv3-MIL: Per-Kidney Multi-Label Tumour and Cyst Detection from Foundation-Model Patch Tokens on KiTS23
摘要
在自然图像上训练的基础视觉模型可以在没有域 预训练 的情况下转移到医疗任务,但体积分类需要在每次研究中聚合数以万计的补丁标记,并且聚合器限制了如何解释结果模型。我们比较了 KiTS23(966 个肾脏;n=97 测试)上用于肾肿瘤/囊肿检测的相同冷冻 DINOv3 ViT-H/16+ 特征的三个聚合器:CLS 词元线性探针、超过 55,296 个补丁词元的门控注意多实例学习 (MIL) 以及遵循 ProtoViT 的原型头。 Attention MIL 在肿瘤(0.74,95% CI 0.64-0.83)和囊肿(0.80,0.70-0.88)方面实现了最高的 AUROC,注意力比注释病变内的机会丰富了 7.5-9.8 倍。原型头不会转移到囊肿检测(AUROC 0.51),从而暴露出在此词元规模上的可解释性与性能的权衡。