论文

词元预算 蒸馏:将全词元语义转移到压缩视频视觉语言模型

Token-Budget Distillation: Transferring Full-Token Semantics to Compressed Video Vision-Language Models

摘要

适应视频视觉语言模型 (VLM) 的计算成本很高,因为视频输入会产生大量视觉标记,使得 微调 和推理成本高昂。尽管视觉词元压缩可以减少这种开销,但对压缩输入的直接适应通常会导致语义漂移和明显的性能下降。我们提出了 Token-Budget 蒸馏 (TBD),这是一个参数高效的 微调 框架,用于在固定的 词元预算 下调整视频 VLM。 TBD 冻结预训练主干,仅更新 LoRA 适配器,并将基于 FlashVID 的视觉词元压缩集成到视频路径中。为了在压缩下保留全词元语义,TBD 采用双路径教师-学生设计,其中全词元教师提供稳定的监督,而压缩学生则通过任务丢失、答案区域 KL 蒸馏、GT 锚定边缘 蒸馏 和可靠性感知 KD 控制进行优化。这种设计使学生能够恢复全词元模型的语义行为,同时在积极的词元减少下保持高效。我们在四个视频理解基准测试中对三个视频 VLM 主干(包括 LLaVA-Video、LLaVA-OneVision 和 Qwen3-VL-8B-Instruct)进行了 TBD 评估。在中等和剧烈压缩下,TBD 始终优于仅压缩基线。在 LLaVA-Video 上,保留率 R = 10%,TBD 保留了 Vanilla 模型平均准确度的 97.0%;在 R = 10% 的 LLaVA-OneVision 上,它的平均得分为 58.4,相对准确度为 100.0%。