论文

用于快速调整生物医学视觉语言模型的几何感知 蒸馏

Geometry-Aware Distillation for Prompt Tuning Biomedical Vision-Language Models

摘要

当前基于提示和基于适配器的视觉语言模型(VLM)调整对于医学成像很有吸引力,其中临床数据敏感性有利于冻结主干,并且注释受到限制。然而,这些方法通常仅优化 真值 类,将所有其他类视为同样不正确,忽略具有临床意义的类关系,并在有限监督设置中产生不稳定的决策边界。我们提出了 Omni-Geometry 知识蒸馏 (OGKD),这是一种新框架,它将类关系结构注入教师中,以生成保留 真值 同时尊重类间几何的定向目标。使用这些目标,我们开发了两个 蒸馏 损失:全局几何感知 蒸馏 (GAD) 在全局图像词元上运行,标签引导几何 蒸馏 (LGD) 将相同的几何应用于关注补丁词元以改善细粒度对齐。通过对 11 个广泛使用的医学数据集进行基础到新颖和小样本评估的综合实验和分析,我们的 OGKD 实现了显着更好的性能,与所有先前最先进的 VLM 适应同行相比,持续提高了准确度,平均绝对增益为 1.7%-2.8%。它还可以稳健地推广到未见过的类别,并产生比其他方法更可靠的预测。我们的代码可在 https://github.com/tientrandinh/OGKD 获取。