论文
Evi-Steer:学习通过高效且可推广的证据调整来引导生物医学视觉语言模型
Evi-Steer: Learning to Steer Biomedical Vision-Language Models through Efficient and Generalizable Evidential Tuning
摘要
视觉语言基础模型的参数高效适应对于生物医学图像的精确多模态理解至关重要,但现有方法仍然是确定性的,并且经常在域转移或模糊的图像文本对齐情况下陷入困境。这种限制在临床中尤其重要,模型应在低数据状态和领域转移中保持稳健。我们提出了 Evi-Steer,这是一种用于 BiomedCLIP 的证据性跨模态低维转向框架,它能够实现不确定性参数高效的 微调,同时仅更新总模型参数的 0.11%。我们的方法在视觉和文本编码器中执行轻量级低维标记更新,同时估计认知不确定性。这些不确定性估计会更新门残差,使模型能够在证据薄弱时保守地进行调整。此外,我们引入了基于 Dempster-Shafer 理论的跨模态置信度融合,使视觉适应能够以文本置信度为条件,并抑制冲突或不确定的跨模态更新。我们在少样本学习和领域泛化设置下对涵盖 8 个器官和 8 种成像模式的 15 个生物医学成像数据集进行了全面评估。 Evi-Steer 在几次学习和领域转移设置下始终优于最先进的方法,展示了在现实临床环境中部署视觉语言模型的实用且强大的途径。代码可在 https://github.com/HealthX-Lab/Evi-Steer 获取。