论文

稀疏频谱 LoRA:医疗 VLM 的路由专家

Sparse Spectral LoRA: Routed Experts for Medical VLMs

模型训练参数高效训练

摘要

大型视觉语言模型(VLM)在一般基准上表现出色,但在医学成像中通常缺乏鲁棒性,其中异构监督会导致跨数据集干扰和对数据机制(即监督信号如何混合)的敏感性。在现实的临床工作流程中,数据和任务是按顺序到达的,因此天真的持续训练会进一步导致灾难性的遗忘。为了应对这些挑战,我们提出了 MedQwen,一种参数高效的医疗 VLM,它将光谱路由专家混合 (MoE) 与理论基础的缩放规则相结合,将低秩更新与全秩、完全微调的 MoE 对齐,而不改变基本架构。具体来说,我们从预训练权重的非重叠奇异值分解(SVD)段初始化每个专家,并引入残差补偿和缩放方案,以在分布偏移下实现稳定的专家专业化和一致的路由。在涵盖视觉问答、报告生成、放射学分类和幻觉缓解的 23 个医疗数据集中,MedQwen 实现了强大、可靠的性能:它在零样本分类上接近完整的 微调,可训练参数减少了 339$\times$,并将顺序遗忘减少到 $\sim$5\%,其中强基线下降 $>$20-50\%。