论文

研究跨模式技能注入:场景、方法和超参数

Investigating Cross-Modal Skill Injection: Scenarios, Methods, and Hyperparameters

模型优化模型合并

摘要

视觉语言模型(VLM)在一般多模态理解方面表现出了卓越的能力;然而,他们很难有效地获得不断发展的特定领域技能。增强 VLM 功能的传统方法(例如监督式 微调 (SFT))需要大量数据集管理和大量计算资源。模型合并已成为一种有效的替代方案,可以将特定领域的专业知识从 大语言模型 (LLM) 转移到 VLM,而不会产生额外的训练数据要求或大量的计算开销。与主要聚合现有能力的同质 LLM 的传统合并不同,跨模式技能注入旨在通过将领域专家 LLM 集成到 VLM 中来引发紧急的跨模式能力。然而,现有研究缺乏对跨模态技能注入的适用性和方法论的系统分析。在本研究中,我们从三个主要方面研究跨模式技能注入:场景、方法和超参数。对于场景,我们发现跨模式技能注入通常在指令遵循和跨语言设置中表现良好,但在数学推理方面却表现不佳。对于方法,我们发现 TA 和 DARE 等经典方法始终比其他合并方法具有更优越的性能。我们还对这些经典方法关键依赖的超参数调整进行了系统的定量分析。