论文
使用时空稀疏自动编码器解释视频表示
Interpreting Video Representations with Spatio-Temporal Sparse Autoencoders
摘要
我们提出了关于视频表示的稀疏自动编码器(SAE)的第一个系统研究。标准 SAE 将视频分解为可解释的单语义特征,但会破坏时间连贯性:硬 TopK 选择会导致跨帧的特征分配不稳定,从而将自相关性降低 36%。我们提出时空对比目标和俄罗斯套娃分层分组,以恢复甚至超过原始时间一致性。对比损失权重控制重建和时间相干性之间的可调权衡。对两个主干网和两个数据集的系统消融表明,不同的配置在不同的目标上表现出色:重建保真度、时间连贯性、动作辨别或可解释性。对比 SAE 功能将动作分类比原始功能提高了 +3.9 个百分点,将文本视频检索提高了高达 2.8 x R@1。跨主干分析表明,标准单语义度量包含主干对齐伪影:DINOv2 和 VideoMAE 在独立 (CLIP) 相似性空间下产生同样的单语义特征。有针对性的特征消融表明对比训练将探针的预测信号集中到少量可识别的特征中。补充材料、代码、配置和评估脚本可在 https://github.com/atahandokme/spatio-temporal-sparse-autoencoders-video 获取。