论文
V-CAST:视频曲率感知时空修剪,实现高效视频 大语言模型
V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models
摘要
视频大语言模型(VideoLLM)在视频理解方面表现出强大的能力,但长上下文推理在预填充阶段仍然以大量冗余视觉标记为主。我们在预算紧张的情况下重新审视 VideoLLM 的词元压缩,并确定了一个关键瓶颈,即时空信息覆盖不足。现有方法通常通过粗略的每帧分配或场景分割引入不连续覆盖,并且标记合并可以在 MRoPE 风格的离散 (t,h,w) 绑定下进一步错位时空坐标。为了解决这些问题,我们提出了 V-CAST(视频曲率感知时空剪枝),这是一种 无需训练,用于长上下文视频推理的即插即用剪枝策略。 V-CAST 将词元压缩视为轨迹近似问题,并引入曲率引导的时间分配模块,该模块将每帧 词元预算 路由到语义转弯和事件边界。它进一步采用了双锚空间选择机制,无需注意干预即可保留高熵视觉证据,同时将保留的标记保持在原始坐标以保持位置对齐。在不同架构和规模的多个 VideoLLM 上进行的大量实验表明,V-CAST 实现了原始性能的 98.6%,平均比第二好的方法高出 1.1%,并将峰值内存和总延迟降低至普通 Qwen3-VL-8B-Instruct 的 86.7% 和 86.4%。