论文

用于视频语言模型中高效推理的自适应两阶段视觉标记修剪

Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models

模型推理推理加速

摘要

视觉语言模型在图像和视频理解方面表现出色,但由于每个图像需要处理数千个词元,因此存在高推理延迟,限制了它们在资源有限的边缘设备和实时监控应用程序中的部署。这一挑战在视频处理中进一步放大,必须同时分析多个帧。现有的词元缩减技术主要是针对单图像输入而开发的,因此无法考虑视频序列中存在的时间和帧间冗余。此外,这些方法通常依赖于在所有输入上应用固定、统一的修剪比率,这是次优的,因为不同视频之间的冗余程度可能会有很大差异,需要依赖于内容的修剪级别来保留关键信息。为了解决这些限制,我们提出了一种专门为视频处理设计的两阶段自适应词元修剪策略。在第一阶段,我们剪掉冗余帧,在第二阶段,在保留帧内应用 词元级 剪枝。至关重要的是,第二阶段的修剪比率是根据每个视频的内容自适应确定的。这是通过分析词元嵌入的相关结构来量化冗余来实现的,冗余用于确定比率。重要的是,我们的方法完全是事后的,不需要额外的训练或 微调,同时实现了强大的经验收益;值得注意的是,它在 10% 词元保留的视频描述基准上将准确性提高了 7%,同时将计算 TFLOP 减少了 95%。