论文

忘记、预测和适应:长视频的测试时间训练

Forget, Anticipate and Adapt: Test Time Training for Long Videos

模型训练持续学习

摘要

测试时间训练 (TTT) 是一种机制,其中模型通过执行一些自监督 (SSL) 任务并更新其权重(即使在推理过程中)来适应传入的测试样本。此过程在测试时不需要标签。本文重点关注长视频的 TTT。现有方法的一个主要问题是:1)它们使用包含过去帧的滑动窗口执行 TTT 更新,其计算量随着窗口大小线性增加。当视频长达数小时时,这在计算上变得很困难。 2) 即使时间上接近的帧看起来相似,TTT 也会执行,从而消耗大量计算。我们提出帧遗忘网络(FFN):1)仅对滑动窗口内的三个帧进行操作,即退出的帧、当前帧和之后的帧。该模型仍然设法保留时间上下文并可工作数小时的长视频; 2)从数学上定义一个惊喜度量:输入帧相对于过去看到的帧包含多少新信息。这有助于确定如何在TTT期间修改有效窗口大小,并构成自适应加窗算法的核心机制。此外,我们还策划了一个数据集 EpicTours,其中包含长达 3 小时的步行城市游览视频,而早期关于此问题的数据集只有 5 分钟长。我们证明了 FFN 在密集分割、视频分类任务、深度估计泛化和多小时长视频方面的经验有效性。