论文

针对医学基础模型的深度重编程 蒸馏

Deep Reprogramming Distillation for Medical Foundation Models

摘要

在大规模数据集上预训练的医学基础模型显示出强大的通用性能。然而,在针对特定医疗场景调整医学基础模型时,由于 预训练 与下游任务之间的差异、现实世界的计算和速度限制造成的差距,这仍然是不可避免的挑战。可能应对这一挑战的相关技术或多或少地受到一些内在的限制。例如,知识蒸馏(KD)假设教师和学生模型共享相同的任务、训练策略和模型结构族,而流行的参数高效微调(PEFT)无法实现个性化和轻量级部署。即使将 PEFT 和 KD 相结合,仍然难以解决教师模型和学生模型之间的模型结构和训练策略不一致的问题,从而导致知识转移效率低下。在这项研究中,我们提出了一种名为深度重编程 蒸馏 (DRD) 的新颖框架来应对一般的适应挑战。具体来说,DRD 引入了新颖的重编程模块,一方面克服了预训练和下游场景之间的领域和任务差异,另一方面构建了从基础模型到轻量级下游模型的学生友好型高效 蒸馏。此外,为了减轻不同训练条件下的变异性,我们设计了一种中心核对齐(CKA)蒸馏 方法来促进稳健的知识迁移。实证结果表明,DRD在不同基础模型下的18个医疗下游任务上超越了之前的PEFT和KD方法,涵盖了包括2D/3D分类和2D/3D分割在内的各种场景。