论文

HEED:混合视觉语言模型的密度加权残差对齐 蒸馏

HEED: Density-Weighted Residual Alignment for Hybrid Vision-Language Model Distillation

摘要

将视觉语言模型提炼成更快的混合架构,例如 3:1 Mamba-2/注意力混合,现在是提高推理效率的标准做法。总体基准表明这是可行的,但它们隐藏了选择性失败。当我们将 Qwen3-VL-8B-Instruct 提炼成 3:1 Mamba-2/注意力混合体时,学生模型在 MMStar、MMBench 和 MMMU-Pro 等视觉推理基准测试中与教师模型的差距保持在 2 分以内,而在光学字符识别和文档任务上则下降了 13 分。学生仍然可以理解场景,但失去了回答所需的细粒度文本。我们将大部分失败归咎于某种特定的位置。在高分辨率图像中,大多数块是天空、墙壁或平滑纹理,而一小部分带有文本、边缘、对象边界或其他局部细节。在 词元级 诊断中,前 10% 最高密度斑块的残余漂移比后 10% 最低密度斑块大 3.6$\time$,教师掩蔽答案贡献大 3.5$\time$。均匀加权将许多损失项投入到低信息背景补丁中,而稀疏的带有答案的补丁没有受到特殊保护。所需的干预是最小的:我们用密度加权残差对齐替换统一残差对齐,使用补丁自相似性作为位置重要性的 无需训练 代理。我们称之为“注意”。与普通端到端 蒸馏 相比,HEED 在 OCRBench v2 上的性能提高了 8.7 分,在 10 个基准测试的平均值上提高了 5.13 分。这种增益是在不同的教师模型和混合架构上实现的。在标准 后训练 之后,学生在 10 个基准测试平均值上达到了教师水平的性能,吞吐量为 4.12$\times$,在 128k 上下文中节省了 68% 的内存,无需额外参数,也没有推理时间成本。