论文
STAC:用于视频推理分割的选择性时空聚合和压缩
STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation
摘要
视频推理分割需要在复杂的自然语言查询下跨数百帧进行像素精确的对象跟踪,产生密集的时空标记,其二次自注意力成本使得长视频处理变得令人望而却步。现有方法通过词元压缩来解决这个问题,但通常对缺乏时间上下文的编码器特征进行操作,在可以可靠地评估内容冗余之前限制选择。知情压缩需要上下文感知,但以全分辨率获取这种感知会导致压缩旨在降低的相同二次成本。状态空间模型解决了这个约束,因为它们的线性递归以 $\mathcal{O}(T)$ 成本选择性地条件化时间上下文上的每个标记,从而生成可评估内容冗余的表示。在此基础上,选择性时空聚合和压缩(STAC)通过解耦的双向空间和因果时间扫描丰富了特征,利用递归衍生的冗余进行分层压缩,并通过分段目标优化了自适应阈值。 STAC 实现了 85% 的词元减少和 1.8$\times$ 加速,同时在零样本流兼容设置中的推理分段基准上超越了无压缩基线。代码可在 \href{https://github.com/MCG-NKU/nku-video}{here} 获取。