论文

用冻结图像基础模型探索低数据量视频预训练

Towards Data-Efficient Video Pre-training with Frozen Image Foundation Models

模型训练预训练

摘要

视频基础模型在多种理解任务上表现出色,但通常需要海量视频数据进行大规模预训练,数据和计算成本很高。图像基础模型已能提供较强的空间表示,因此本文提出问题:能否复用这些表示,仅针对时间推理预训练,从而构建有竞争力的视频模型? 作者初步探索一种轻量训练方式,冻结预训练图像基础模型,只训练循环时间模块处理流式视频。与端到端视频预训练相比,复用图像空间编码器有望减少视频数据和计算需求。本文先研究可行性,再考虑投入视频预训练资源。多项视频理解任务的结果显示,即使没有大规模视频预训练,也可能获得较强的时间性能,为后续在冻结图像模型之上预训练循环时间模块提供研究方向。代码:https://github.com/tue-mps/towards-video-image-frozen。