论文

用于多任务医学视觉语言学习的两阶段 LoRA 混合

Two-Stage Mixture-of-LoRA for Multi-Task Medical Vision-Language Learning

模型训练参数高效训练

摘要

医学视觉语言模型 (VLM) 允许单个模型执行从诊断分类到报告生成的临床图像分析任务。然而,联合适应面临着异构输出格式、冲突的任务梯度和不平衡的训练数据的挑战。因此,我们提出了 \textbf{Two-Stage Mixture-of-LoRA},一个基于 MedGemma-1.5-4B 构建的框架。该框架使用共享特定的 LoRA 混合架构,包括一个共享 LoRA 和六个特定任务专家 LoRA,以及两阶段训练程序。在第一阶段,我们在所有任务上联合训练共享 LoRA 和所有特定任务的专家 LoRA。在第二阶段,我们首先冻结骨干网、共享LoRA和所有非目标专家,一次细化一个任务专家。然后,分类和回归获得额外的模态平衡延续,其中较小的模态组被重复以匹配最大的组。在 FLARE 2026 Task 3 测试集中,该方法实现了 0.85 的分类平衡精度、0.48 的多标签分类 micro-F1、0.79 的检测 F1 和 17.39 的回归 MAE。代码可在 https://github.com/YuanYL03/MICCAI-FLARE-2026-Challenge-Task3-2D 获取。