论文

边缘视觉语言模型的跨模态对齐的高效量化感知蒸馏

Efficient Quantization-Aware Distillation with Cross-Modal Alignment for Edge Vision-Language Models

摘要

CLIP 等大规模视觉语言模型 (VLM) 可实现强大的开放词汇推理,但在资源受限的边缘设备上部署这些功能仍然具有挑战性。 EdgeVL 通过将 CLIP 表示提炼为轻量级多模态编码器并应用量化感知训练 (QAT) 来在边缘硬件上实现高效的开放词汇分类 (OVC) 来解决此问题。然而,其两阶段优化对蒸馏和 QAT 应用了不同的目标,并且在量化的学生空间内进行对比学习,这可能会导致优化不一致并降低训练效率。此外,RGB 和非 RGB 模式的相同监督可能会导致模式不平衡。我们提出了一个针对边缘部署的量化语义蒸馏的统一框架。通过在统一的教师锚定框架内联合优化蒸馏和量化,我们的方法确保量化下的一致训练,抑制硬负例并扩大决策余量。此外,我们设计了一个轻量级的交叉注意力适配器,通过 RGB 引导的语义传输增强非 RGB 表示,缩小模态差距。大量实验表明,在保持部署效率的同时,非 RGB 模式得到了持续改进。