论文
BioMedVR:用于生物医学视觉重编程的混淆感知混合提示专家
BioMedVR: Confusion-Aware Mixture-of-Prompt Experts for Biomedical Visual Reprogramming
摘要
CLIP 等视觉语言模型 (VLM) 的最新进展已经证明了跨自然图像领域的强大泛化性。然而,使这些模型适应生物医学成像并非易事:全模型 微调 的计算成本很高,而医学数据通常稀缺,并且表现出微妙、细粒度的类间差异,使得参数高效的适应尤为重要。视觉重编程 (VR) 通过向输入空间注入可学习的扰动,提供了一种参数高效的替代方案,但现有的 VLM VR 方法主要关注正类提示,而忽略了令人困惑的负类提示,导致细粒度医疗场景中的预测出现错误。我们推出了 BioMedVR,这是第一个基于 VR 的生物医学成像框架,可通过紧凑的可学习 VR 模块对预训练的 VLM 进行少量调整。为了减轻类别混淆,我们引入了一种混淆最小化机制,该机制利用 LLM 生成的混淆感知属性以及混淆抑制损失来显式减少误报对齐。此外,设计的混合提示专家结合了用于主类别区分的正专家和用于混淆抑制的负专家,并通过自适应门控进行平衡。对 18 个数据集(包括 11 个生物医学数据集和 7 个自然图像基准)的广泛实验表明 BioMedVR 实现了卓越的准确性和泛化性,有效地桥接了生物医学领域的 VR 和 VLM。