论文

LLaVA-CKD:用于视觉语言模型的自下而上级联 知识蒸馏

LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models

摘要

大型视觉语言模型 (VLM) 成功地解决了多种视觉语言理解任务,例如视觉问答 (VQA),但它们的内存和计算要求仍然是实际部署的一个问题。 知识蒸馏 是缓解这种担忧的一类很有前途的技术,其中来自大容量教师网络的知识被转移到相当小的学生网络。然而,两个网络之间的容量差距既是福也是祸:Student网络越小,其效率越好,而Teacher网络越大,承载的知识越多;然而,超过一定程度后,两者之间较大的能力差距会导致知识转移更差。为了抵消这种影响,我们提出了一个自下而上的级联 知识蒸馏 (CKD) 框架。受人类正规教育系统的启发,我们没有将知识转移视为涉及一名高能力教师(或此类教师的整体)的活动,而是引入了一名(可能是更多)中等能力的额外教师,逐渐将学生网络提升到一个新的水平,下一个(更高能力的)教师可以接管。我们提供了理论分析,以研究级联 蒸馏 对 Student 泛化性能的影响。我们将所提出的框架应用于基于 LLaVA 方法的模型,并在七个标准的、公开的 VQA 基准上评估派生模型,展示其 SotA 性能。