论文

CT 基础模型的解剖情境适应

Anatomy Contextualized Adaptation of CT Foundation Models

模型训练参数高效训练

摘要

CT 视觉语言基础模型在下游任务中表现出了良好的性能,但通常采用全体积表示进行训练,从而稀释了细粒度的解剖信号。细粒度视觉语言 预训练 通过将解剖级视觉特征与特定于解剖学的文本对齐来解决这个问题,但这样做会丢弃全体积模型提供的全局上下文。此外,现有的细粒度方法是从头开始训练的,这使得它们的计算成本很高。我们引入了解剖情境化适应 (ACA),这是一个轻量级框架,可适应冷冻 CT 基础模型表示,以实现解剖级视觉语言对齐,同时增强全局情境化。 ACA 使用 TotalSegmentator 将 CT 体积分解为解剖级嵌入,这些嵌入通过捕获跨解剖关系的 Transformer 进行细化,并与从放射学报告中提取的按解剖结构和扫描级文本对齐。在 Merlin 和 CT-RATE 上进行评估,ACA 在零样本查找分类方面始终优于冻结的基础模型基线和现有的细粒度方法,同时缓存嵌入后所需的训练时间不到一小时。 ACA 的内部解剖学 Transformer 学习到的注意力权重还表明了合理的跨解剖学上下文路由。总而言之,这些结果支持 ACA 作为一种轻量级方法,使 CT 基础模型适应解剖学基础的视觉语言对齐,同时保留和增强全局解剖背景。