论文
研究视频变压器中的时空冗余以进行碰撞预测
Investigating Spatiotemporal Redundancy in Video Transformer for Collision Anticipation
摘要
在工人设备接近监控中,视频变压器广泛用于碰撞预测,并表现出强大的性能。然而,它们的准确性伴随着大量的计算需求,这与移动机器人低延迟推理的需求和建筑中低碳计算的追求产生了矛盾。为了解决这个问题,本研究调查了已建立的视频转换器内的计算在哪里是冗余的,以及是否可以在不显着降低预测性能的情况下消除该冗余。使用 Nexar 碰撞预测数据集上的 VideoMAEv2-Base,我们首先检查碰撞相关信息如何在网络深度上演变,然后研究两种互补形式的冗余:多层感知器 (MLP) 中的结构化容量冗余和token流中的时空冗余。线性探针显示可解释的运动线索,包括流量大小、隐现以及接近与撤退,在中间层最容易获得,而碰撞标签区分能力在最后一层增强。 token冗余是特定于轴的:相邻时间token相似性在后面的层中达到 0.970,而空间相似性下降到 0.297,表明跨时间的冗余比跨空间的冗余大得多。利用这种不对称性,时间token合并将骨干模型计算量从 356.99 GFLOP 减少到 178.50 GFLOP,并将每个剪辑的延迟从 12.69 毫秒减少到 7.21 毫秒,加速了 1.76 倍,而平均精度仅从 0.7478 变化到 0.7443。 50% 的 MLP 单元的重要性引导保留保留了 0.753 的 AUC,而匹配随机保留下的 AUC 为 0.529,并揭示了修剪在判别性排名崩溃之前改变了分数校准。这些发现为通过有针对性的时间token压缩和神经元修剪来追求更快的算法建立了一条新途径。