论文
AdaSpark:自适应稀疏性以实现高效的长视频理解
AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding
摘要
使用 Video 大语言模型 (Video-LLM) 处理长格式视频的计算量非常大。当前的效率方法通常通过不可逆的信息处理来损害细粒度的感知,或者通过严格的、预定义的稀疏模式来抑制远程时间建模。本文介绍了 AdaSpark,这是一种旨在解决这些限制的自适应稀疏框架。 AdaSpark 首先将视频输入划分为 3D 时空立方体。然后,它采用两个共同设计的上下文感知组件:(1) 自适应立方体选择性注意 (AdaS-Attn),它自适应地选择相关视频立方体的子集来关注每个查询标记;(2) 自适应标记选择性 FFN (AdaS-FFN),它仅有选择地处理每个立方体内最显着的标记。基于熵(Top-p)的选择机制根据输入复杂性自适应地分配计算资源。实验表明,AdaSpark 显着降低了高达 57% FLOP 的计算负载,同时保持了与密集模型相当的性能,并保留了细粒度、长范围的依赖关系,这一点在具有挑战性的小时尺度视频基准测试中得到了验证。