冷冻基础模型嵌入丢弃胸部放射照相中的小病变信号:对部署前评估的影响
Frozen Foundation-Model Embeddings Discard Small-Lesion Signal in Chest Radiography: Implications for Pre-Deployment Evaluation
摘要
冻结视觉 - Transformer (ViT) 基础模型嵌入越来越多地充当下游胸部放射成像 (CXR) 管道的基础,但在冻结前向传递中保留或丢失小规模、低对比度信号的情况尚未跨架构、预训练域和目标进行系统量化。我们在三个大型 CXR 队列(NIH-CXR14、MIMIC-CXR、Emory-CXR;聚合池 n=492,724)和 ChestX-Det10 中探测了 5 个冷冻 ViT(RAD-DINO、DINOv2-B/14、DINOv3 ViT-7B、BiomedCLIP、MedSigLIP)和冷冻 DINO 预训练 ResNet-50 架构对照。 (n=3,543;钙化、结节、肿块上的 1,462 个小病变边界框)。每个模型都使用小规模扰动面板和区域感知边界框分层探针对真实病变进行评估,比较来自同一前向传递的三种池化模式:分类标记(CLS)、补丁均值(所有最终层补丁标记的平均值)和边界框限制补丁局部。在扰动面板上,CLS 嵌入位于机会层(ROC 曲线下面积 [AUC] 0.500-0.524);在等模糊和网状细细胞上,补丁均值与 CLS 没有区别,但在较大的方向模糊足迹上,补丁均值随 CLS 上升,而全局决定任务上的疾病 AUC 范围为 0.642-0.913。局部补丁探针从相同的前向传递中恢复了 AUC ~1.0(每个模型平均改进 +0.412 至 +0.488); ResNet-50 控件再现了机会层。在 ChestX-Det10 上,图像级 CLS 分类显示类内小层与大层差距高达 +0.243 AUC;同一正向传递上的边界框级补丁本地池在每个(模型 x 类)单元上恢复了 AUC >= 0.899。冻结的 ViT 嵌入在全局聚合步骤中默默地抑制小规模信号;信号可以从补丁词元中恢复,条件是感兴趣的区域。