论文

SAM+D:通过深度路由 LoRA 和深度平移对 SAM 系列模型进行参数高效的维度提升

SAM+D: Parameter-Efficient Dimensional Lifting of SAM-Family Models via Depth-Routed LoRA and Depth Shifting

模型训练参数高效训练

摘要

将 2D 基础模型(例如 SAM)调整为 3D 体积的现有方法要么独立处理切片(忽略切片间上下文),要么需要大量的架构更改和重新训练。在本文中,我们提出了 \textbf{SAM+D},这是一种参数高效的框架,可将 SAM 系列模型提升一个空间维度——从 2D SAM 实现 3D 体积分割,并首次通过参数高效的 微调 从基于视频的 SAM2 实现端到端 4D (3D+T) 时空分割——同时保持绝大多数预训练参数的冻结。 SAM+D 在冻结的 Transformer 块中引入了两个轻量级、与模型无关的模块:(1)~\textbf{深度路由 LoRA (DRLoRA)} 专家,具有用于空间自适应低秩更新的学习路由,以及 (2)~\textbf{深度移位模块 (DSM)},用于以零额外参数成本进行跨切片特征交换。它们一起提供音量级上下文,同时仅调整 SAM 的 ${\sim}$2.8\% 参数和 SAM2 的 ${\sim}$3.7\% 参数。我们在两种不同的设置中评估 SAM+D,每种设置将基础模型提升一个空间维度:3D 分割,其中 SAM(2D$\,\to\,$3D) 在四个 CT 基准(KiTS、胰腺、LiTS、结肠)上进行评估;4D 分割,其中 SAM2 (2D+T$\,\to\,$3D+T) 在细胞跟踪挑战 (CTC) 数据集上进行评估(荧光-N3DH-SIM+)。在这两种设置中,SAM+D 在单点提示设置下都取得了有竞争力或优异的结果,同时使用比现有方法更少的可训练参数,这表明 SAM+D 可以推广到 SAM 系列架构、目标维度(3D、4D)以及跨越医学成像和生物场景理解的领域。代码可在 https://github.com/JerrySongCST/SAM-Plus-D 上公开获取。