论文

CIVIC:面向高效视觉语言模型的端到端序列紧凑化

CIVIC: End-to-End Sequence Compactness for Efficient Vision-Language Models

模型推理推理加速

摘要

视觉语言模型(VLM)因高分辨率视觉token而面临严重的内存与时延瓶颈。当前token缩减方法虽在理论上节省FLOPs,但事后剪枝引入结构性开销,无法带来等比例的实际加速。然而,强制一条连续的紧凑通路又有几何迷失与细粒度定位丢失的风险。为克服这些障碍,本文提出CIVIC,一个路径一致的紧凑视觉推理框架。通过在视觉编码器、投影层、LLM预填充与KV-cache之间无缝维持紧凑序列表示,CIVIC避免了非连续内存访问与局部解合并开销。在Qwen3-VL架构上的评估显示,CIVIC成功将序列缩减转化为真实的物理硬件效率,把KV-cache内存压缩至基线的约三分之一,并降低端到端推理时延。借助文本对齐的KL蒸馏与自适应空间保留下限,CIVIC在严格的多模态推理与视觉定位基准上实现了这些效率里程碑而不损失精度。

CIVIC:面向高效视觉语言模型的端到端序列紧凑化:论文配图
图1:近期高效VLM方法在Qwen3-VL 2B上理论压缩率与实际推理行为的对比,暴露序列紧凑化的现实差距。