论文

P3CA:通过空间探测对视觉基础模型嵌入进行与编码器无关的解释

P3CA: Encoder-Agnostic Interpretation of Vision Foundation Model Embeddings via Spatial Probing

模型评测模型行为与机制分析

摘要

视觉基础模型越来越多地用作医学图像计算中的可重用编码器,但其高维空间嵌入除了下游任务性能或全局降维之外很难检查。我们提出了位置提示的 PCA (P3CA),这是一种与编码器无关的方法,用于局部探测通道丰富的空间张量。给定用户选择的空间提示,P3CA 估计该区域内的特征归一化和主导协方差方向,然后将所得投影应用于完整张量,以可视化表达局部信息方向的位置。这会产生区域条件表示透镜,而无需修改编码器、重新训练或需要特定于任务的标签。我们在 EmbedVision(一种基于交互式 3D Slicer 的工作流程)中实现 P3CA,并在自然图像、结直肠病理学基础模型嵌入和空间转录组张量中对其进行评估。在这些设置中,提示投影揭​​示了全局 PCA 抑制的局部结构,改善了来自冻结三维投影的提示匹配病理区分,并支持学习和测量的空间表示之间的比较。