论文

TCLA:无需训练 医疗视觉语言模型的分类 logits 适应

TCLA: Training-Free Class-wise Logit Adaptation for Medical Vision-Language Models

模型推理解码与生成控制

摘要

医学视觉语言模型 (VLM) 表现出强大的零样本性能,但由于大规模预训练继承的域转移和类偏差,其在分布外 (OOD) 数据上的有效性仍然下降。现有的少样本适应方法通常引入额外的可训练组件,这些组件在极低数据状态(例如,1-shot)中可能不稳定,并且缺乏对不同医疗数据的鲁棒性。我们提出了 TCLA,这是一种用于医学 VLM 的纯粹的 无需训练 少样本自适应方法,该方法速度快且与模型无关。 TCLA 基于一小组支持样本纠正推理 logits,通过改进类间解混淆和减少域移位来提高预训练 VLM 的性能。对跨多种医学成像模式(包括 X 射线、超声、MRI、CT、组织病理学)的 9 个数据集进行的广泛实验表明,TCLA 持续提高了医学 VLM 的 OOD 性能,并且在大多数情况下优于现有的基于训练的适应方法。