论文

医疗 LVLM 的模型合并:基准和赢家通吃的方法

Model Merging for Medical LVLMs: A Benchmark and a Winner-Take-All Approach

模型优化模型合并

摘要

大型视觉语言模型(LVLM)可以通过参数高效的 微调 方法(例如低秩适应(LoRA))适应专门的医学成像任务,从而形成一个不断发展的针对特定成像模式和临床场景的专家模型生态系统。然而,在实践中部署多个专家 LVLM 会产生大量的计算和操作开销。模型合并通过将多个专家合并到一个模型中而无需重新训练,提供了一种有前途的解决方案,但它在医学领域仍然很大程度上未经探索。在这项工作中,我们首次提出了医学 LVLM 模型合并的系统研究。我们推出 MergeMedBench,这是一个涵盖八种成像模式和多种临床任务类型的综合基准测试,包含基于两种主流架构构建的 16 个 LoRA 微调模型。我们对现有的合并方法进行了广泛的评估,并进一步提出了赢家通吃的方法,这是一种简单且无超参数的方法,仅保留专家模型中最主要的参数。通过保留控制模型行为的关键参数并丢弃较弱的参数,我们的方法避免了基于平均或对齐的策略中固有的信息稀释。尽管很简单,但赢家通吃的方法始终优于现有方法,为 LoRA 合并提供了新的视角,并为未来的研究提供了强有力的实用基线。