论文
时间自我-蒸馏:在没有监督的情况下学习视频中的视觉状态跟踪
Temporal Self-Distillation: Learning Visual State Tracking in Videos Without Supervision
摘要
我们引入了 S$^3$T (Self-Supervised Self-蒸馏 over Time),据我们所知,这是第一个完全独立的连续视频状态跟踪框架。我们的方法将时间采样密度视为特权信息,基于这样的假设:同一剪辑的更密集视图可以更准确地恢复运行状态。该视图充当教师,而具有相同权重的稀疏视图学生则学习匹配其下一个标记分布。该模型会生成自己的目标,因此训练不需要标签、单独的教师或奖励信号,并且不会增加推理成本。在 LLaVA-OneVision-2-8B 上,S$^3$T 作为单个模型将 VSTAT 精度提高了 $+1.74$,使用 souping 提高了 $+2.38$,使用额外的视觉编码器自适应提高了 $+2.70$,而之前的自进化方法使状态跟踪基本保持不变。从未标记的合成剪辑中学到的功能转移到真实视频中,在 VSTAT-YouTube 状态跟踪问题上将性能提高了 7.95 美元,在 MVBench 操作计数上将性能提高了 4.50 美元。