论文
动态词元压缩通过强化学习实现高效视频理解
Dynamic Token Compression for Efficient Video Understanding through Reinforcement Learning
摘要
多模态 大语言模型 在视频理解方面表现出了卓越的能力,但由于大量视觉标记冗余,面临着高昂的计算成本和“上下文腐烂”导致的性能下降。现有的压缩策略通常依赖于启发式或固定转换,这些策略通常与下游任务目标分离,限制了它们的适应性和有效性。为了解决这个问题,我们提出了 SCORE(通过强化学习的惊喜增强词元压缩),这是一个学习自适应词元压缩策略的统一框架。 SCORE 引入了一个轻量级策略网络,该网络以意外增强的状态表示为条件,该状态表示结合了帧间残差,以明确捕获时间动态和运动显着性。我们使用带有分割优势估计器的分组强化学习方案来优化该策略,并通过从静态伪视频转移到真实动态视频的两阶段课程来稳定。对各种视频理解基准的大量实验表明,SCORE 的性能显着优于最先进的基准。值得注意的是,SCORE 实现了 16 倍的预填充加速,同时以 10% 的保留率保留了 99.5% 的原始性能,为高效的长格式视频理解提供了可扩展的解决方案。