论文
$\text{PKS}^4$:用于高效视频理解的并行运动选择性状态空间扫描仪
$\text{PKS}^4$:Parallel Kinematic Selective State Space Scanners for Efficient Video Understanding
摘要
时间建模仍然是视频理解中的一个基本挑战,特别是随着序列长度的扩展。依赖密集时空注意力的传统视频模型面临长视频的二次计算成本。为了规避这些成本,最近的方法通过参数高效的 微调 (PEFT) 方法(例如适配器)来调整视频的图像模型。然而,深度插入这些模块会在反向传播期间产生过高的激活内存开销。虽然最近高效的状态空间模型 (SSM) 引入了线性复杂性,但它们破坏了 2D 空间关系,并依赖广泛的屏蔽 预训练 来恢复空间感知。为了克服这些限制,我们提出了并行运动选择性状态空间扫描仪(PKS$^4$)。我们保留了用于空间语义的标准 2D 视觉主干,并插入具有线性复杂性时间扫描的单个即插即用 PKS$^4$ 模块,避免了时间注意力和多层适配器。我们首先通过运动学先验编码器提取运动学先验,该编码器通过帧间相关性和差异捕获局部位移和运动边界。这些先验驱动线性复杂度 SSM 跟踪底层运动状态,在每个时间步自适应地调节更新速度和读写策略。我们不是全局扫描,而是沿着每个空间位置的时间维度部署并行扫描仪,保留空间结构,同时减少开销。对空间重和时间重的动作识别基准的实验表明,PKS$^4$ 实现了最先进的性能。值得注意的是,我们的方法仅在 20个训练轮次内收敛,与纯视频 SSM 相比,训练计算量降低约 10 倍,为高效视频理解建立了新的范例。