论文
从图像潜空间到模糊规则:胃肠道基础模型的可解释分析
From Image Latent Space to Fuzzy Rules: Interpretable Analysis of Gastrointestinal Foundation Model
摘要
在大规模数据集上预训练的基础模型表现出对医学成像任务的强大可移植性。然而,了解它们的潜在表示如何编码临床相关信息仍然是安全关键领域中的一个开放挑战。本研究提出了一种基于原型的模糊规则框架,该框架可以解释预训练基础模型内层产生的补丁级特征,而无需任何微调。通过在特征空间中进行聚类来学习特定于类的原型,从而产生紧凑的视觉模式。然后,补丁特征被表示为原型相似性,并通过具有人类可读的语言 IF-THEN 条件的模糊规则进行分类。该框架应用于在 ImageNet-1K 和 GastroNet-5M 上预训练的 ViT-S/16 主干网的最后两个块,并针对相同冻结特征下的 k 最近邻、内核 SVM 和线性探测、无线胶囊内窥镜分类、胃肠道内窥镜分类和结肠息肉分割进行基准测试。实验分析表明,所提出的方法在没有主干微调的情况下,达到了与这些黑盒分类器相当的精度,并且特定领域的预训练产生了具有判别性和符号可压缩性的特征。由于生成的规则是从真实数据中提取并以可解释的术语表达的,因此它们进一步用作研究合成医学图像的工具,提供人类可读的说明,说明生成器再现或无法再现哪些真实原型和规则,定位合成图像与真实组织的偏离位置,而不是用单个分数对其进行总结。因此,该框架提供了一个透明的、深度解析的视图,显示基础模型如何组织临床相关结构,以及提取规则的实际下游使用。