论文
PCA:快速视频的持久感知压缩和聚合 大语言模型
PCA: Persistence-Aware Compression and Aggregation for Fast Video Large Language Models
摘要
尽管视频 大语言模型 (VLLM) 的进步在视频理解方面显示出了有希望的成果,但长时间帧中的冗余仍然是有效推理的障碍。本文介绍了一种无需训练 $\mathbf{P}$ersistence-Aware $\mathbf{C}$压缩和$\mathbf{A}$聚合(PCA)方法,旨在在编码阶段之前保留高保真原始视觉信息。 PCA 可以构建在任意 VLLM 上,并由两个模块组成:1)动态下采样(DD)模块,通过分析帧间相似性自适应地删除冗余帧。 2) 持久感知运动增强 (PAME) 模块,通过聚合相邻关键帧的时间上下文来丰富每个选定的关键帧,确保即使在大幅减少帧后也能保留基本信息。我们的方法大大减少了长上下文建模的计算量,同时增强了基线模型的性能。大量实验表明,PCA 在效率和准确性方面始终优于现有最先进的方法,与基线 VLLM 相比,加速速度达到 1.8$\times$ 到 2.5$\times$。该代码在 https://github.com/Heisenberg10110/PCA 上开源。