论文
SV-TAD:用于高效时间动作检测的原生稀疏转换
SV-TAD: Native Sparse Convs for Efficient Temporal Action Detection
摘要
为了使数十亿参数的视觉变换器适应长视频理解,最近的方法冻结了主干并训练轻量级卷积模块。虽然对于参数高效的训练有效,但现有的适配器并没有减少推理时间计算,从而导致视频长度的可扩展性在很大程度上没有得到解决。token选择可以通过修剪冗余token来降低注意力成本,但它破坏了卷积适配器所需的空间网格结构。这迫使进行昂贵的密集重建,从而抵消了大部分潜在的加速。我们通过引入原生稀疏 2D 卷积来解决这个问题,该原语首次允许这些适配器直接有效地在动态修剪的token集上进行操作。我们将此原语集成到 SV-TAD(一种用于时间动作检测的适配器框架)中,将 VideoMAEv2-L 计算量减少高达 64%,推理速度提高 2.2 倍,同时保持 THUMOS-14 和 ActivityNet-1.3 上最先进的准确性。当扩展到 InternVideoNext-L 时,我们的方法超越了之前的状态 艺术的计算成本大约是其一半。此外,稀疏公式自然支持辅助任务标记,这改进了 ATTACH 上的细粒度程序集检测。