论文

Frozen 3D CT 视觉编码器中的稀疏概念通道

Sparse Concept Channels in Frozen 3D CT Vision Encoders

模型评测模型行为与机制分析

摘要

大型视觉语言模型在 3D 医学图像解释中变得越来越占主导地位,但我们很少知道<i>哪些</i>内部单元编码临床发现或<i>信息在表示中存在于何处</i>。我们首先通过探测 3D 胸部视觉语言模型 (Pillar-0) 的冻结视觉嵌入来研究这一问题。我们表明,(i) 每个放射学发现均由约 10 个视觉编码器通道的<i>稀疏</i>集进行编码,这些通道与全特征分类性能相匹配,并且远远超过零样本文本提示; (ii) 关闭与一项发现相关的通道,该发现的分数崩溃,而不相关的标签保持稳定; (iii) 相同的稀疏探针在结构上不相关的 3D 腹部 VLM (Merlin) 上进行复制,这表明了冷冻医学编码器的一般特性。我们的 无需训练 概念通道探测 (CCP) 方法与语料库衍生的报告模板配合使用,在临床疗效和 NLG 指标(F1 0.549 与 0.184;BLEU 0.483 与 0.373)方面优于已发布的 CT-CHAT,且延迟降低了 22 倍。我们的结果提供了冷冻医学编码器如何代表研究结果的清晰、可重复的特征,证明了跨模型的直接适用性。