论文
BiomedAP:一种基于视觉的双锚框架,具有门控跨模式融合,可实现稳健的医学视觉语言适应
BiomedAP: A Vision-Informed Dual-Anchor Framework with Gated Cross-Modal Fusion for Robust Medical Vision-Language Adaptation
摘要
生物医学视觉——语言模型(VLM)在几次医疗诊断中表现出了非凡的前景,但面临着一个关键瓶颈:\textit{提示变化的脆弱性}。现有的适应框架通常将视觉和文本提示优化为独立的流,依赖于理想的“黄金提示”。在临床现实中,描述通常是嘈杂且异构的,这种模态隔离会导致不稳定的跨模态对齐。为了解决这个问题,我们提出了 BiomedAP,一种具有门控跨模态融合的视觉通知双锚框架。BiomedAP 通过两种机制强制协同对齐:(1)门控跨模态融合,它能够实现模态之间的分层交互,充当动态噪声调节器来抑制不相关的文本提示; (2) 双锚约束,将可学习的提示规范化为源自专家模板(高锚)和少量视觉原型(低锚)的稳定语义质心。跨越 11 个基准的广泛实验表明,BiomedAP 始终超越基线,实现了具有竞争力的几次射击精度,并在即时扰动下显着增强了鲁棒性。我们的代码位于:https://github.com/tongdiedie/BiomedAP。关键词:视觉语言模型;及时学习;参数高效 微调;少样本学习