论文

Eddy-VL 1.9B:用于边缘可部署多模态嵌入的结构修剪和分层 蒸馏

Eddy-VL 1.9B: Structural Pruning and Layered Distillation for Edge-Deployable Multimodal Embedding

模型优化模型压缩

摘要

在本报告中,我们介绍了 Eddy-VL 1.9B,这是一种基于 Qwen3-VL-Embedding-2B 构建的压缩多模态嵌入模型,用于离线、可边缘部署的视觉语言检索。 Eddy-VL 的目标是云 API 不可用且低延迟至关重要的气隙取证和调查环境。压缩结合了 (i) 探针驱动的结构修剪,删除了按相邻层线性 CKA 排序的四个冗余文本解码器层(28 至 24),以及 (ii) 具有孔覆盖教师-学生映射的分层 知识蒸馏、中间层注意力图 1-CKA 以及最终层 MSE 和余弦损失(Matryoshka 维度为 {128、256、512、 1024, 2048}。发布的模型包含 1,926,188,032 个参数(3.85 GB bf16),比 2.13B 教师模型减少了约 9.5% 的参数。对 MMEB-V2(78 个任务,VLM2Vec 协议)的实证评估表明,Eddy-VL 的总体得分为 63.2,而教师的得分为 68.9,保留了教师的 91.7% 的表现,同时恢复了仅通过剪枝损失的 12.1 分中的 6.4 分(56.8)。 SugarCrepe(86.1 vs. 86.4)、MR2-Bench(24.5 vs. 24.7)和 ARO(59.5 vs. 60.4)上的构图推理表现仍然接近老师,而 Winoground 组表现(6.8 vs. 8.5)仍然是主要限制。深度修剪还可将前向延迟减少约 10%(使用 FlashAttention-2 在 NVIDIA DGX Spark 上每个图像从 150.0 毫秒减少到 136.4 毫秒)。我们提出了架构、压缩方法、训练程序和评估结果,证明了 Eddy-VL 在受限边缘部署下多模态检索的有效性。模型权重和推理代码可在 Hugging Face 上公开获取。