论文

大、明亮或隐形:3D CT 基础模型的冻结特征基准

Big, Bright, or Invisible: A Frozen-Feature Benchmark of 3D CT Foundation Models

模型评测模型能力评测

摘要

常规 CT 判读本质上是全面的,可以捕获整个扫描范围内的偶然发现。 3D CT 基础模型可以通过提供解剖学和病理学的通用表示来协助这一过程。为了评估其诊断广度,我们使用 $k$ 最近邻、零样本提示和线性探测,对三组胸部 CT 扫描中的 10 个冷冻 CT 编码器进行了基准测试,包括未见过的内部临床数据集。我们发现没有普遍的最先进技术,排名根据评估环境而大幅波动。虽然将细粒度图像标记化与视觉语言对齐相结合的模型通常表现最好,但轻量级监督编码器仍然具有很强的竞争力,这表明显式标签可以有效地替代尺度。至关重要的是,我们观察到性能的主要决定因素不是模型架构,而是物理瓶颈:发现的可检测性随着其与周围组织的对比度及其空间范围而变化。通过受控的器官内比较,我们凭经验证明广泛或高对比度的异常,例如装置和积液,可以可靠地恢复。相反,小的、低对比度的局灶性病变仍然是所有评估编码器的持续挑战。我们将此归因于全局池嵌入的固有局限性,这表明准确表示小型、低对比度结构将需要区域或病变级别的预训练。