论文
MOSAIC:用于高效异构视觉语言模型的自适应层间组合
MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models
摘要
视觉语言模型 (VLM) 已成功使用同质 Transformer 来处理多媒体数据。最近的研究表明,异构结构交织有效的机制(如线性注意力),比同构设计提高了性能和推理延迟。然而,这些努力依赖于手工制作的静态混合模式,这些模式不是最佳的并且难以适应特定的硬件。为了弥补这一差距,我们提出了自适应层间组合的多目标搜索(MOSAIC),这是一种硬件感知的搜索方法,可以自动将同构模型转换为优化的异构架构。 MOSAIC 将不同的效率机制(包括线性、稀疏和低秩运算符)集成到统一的搜索空间中。通过将选择公式化为多目标混合整数规划(MIP)问题,我们的方法确定了在严格的硬件延迟约束下最大化下游性能的最佳配置。为了减轻结构转换带来的性能下降,我们引入了一个两阶段参数恢复过程:全局 离策略 蒸馏 来稳定内部表示,然后是双教师 同策略 蒸馏,利用 235B 预言机进行知识扩展,利用原始 4B 教师来实现分布稳定性。我们通过源自 Qwen3-VL-4B-Instruct 的 MOSAIC-4B 验证 MOSAIC。结果表明,MOSAIC-4B 在多个基准测试中与基线性能相匹配,同时所需的训练成本不到原始训练成本的 2%。此外,它还大幅提高了推理效率,实现了 1.76 倍的预填充和 2.54 倍的解码加速。