论文
MAGIC:用于视觉语言模型的多模式对齐和视觉证据关联感知指令核心集
MAGIC: Multimodal Alignment & Grounding-aware Instruction Coreset for Vision-Language Models
摘要
大型视觉语言模型(LVLM)的指令调整越来越依赖于大量多模态语料库,但这些数据集包含的样本具有大量冗余、低视觉依赖性和多模态推理行为的高度不平衡覆盖。因此,统一子采样或基于分数的简单选择通常会产生次优的训练子集。我们引入了 MAGIC,一种 无需训练 的仅前向核心集选择方法,旨在为多模式指令调整构建紧凑但行为可靠的子集。 MAGIC 建立在从预训练的 VLM 中提取的三个内在信号的基础上: 多模态增益,衡量从视觉输入获得的可能性改进;桥接相关性,捕捉答案标记相对于视觉标记的清晰度;和技能神经元签名,它描述了每个样本通过顶部激活的前馈神经元引发的功能计算。 MAGIC 将这些信号组合在一个三级管道中:过滤低增益示例,通过标准化质量目标对候选者进行排名,并对离散神经元签名执行桶式预算分配,以保留潜在的多模态技能覆盖范围。该公式避免了反向传播、辅助选择器训练和连续激活空间中昂贵的聚类,同时在现有 VLM 中保持高效且易于部署。在 LLaVA-665K 和 Vision-Flan 数据集上,以及将设置传输到大型目标模型 LLaVA-1.5-7B 和 -13B 上,MAGIC 在匹配的 20% 预算下始终优于强基线:它在 LLaVA-665K 上实现了 100.3% 的完全微调相对性能,在 Vision-Flan-186K 上实现了 101.6% 的相对性能,同时产生了 73.7%减少挂钟运行时间。