论文

PEEK:通过 Efficient 知识蒸馏 选择基本框架

PEEK: Picking Essential frames via Efficient Knowledge distillation

上下文与知识上下文工程

摘要

视频语言模型只能处理有限数量的帧,这使得帧选择成为高效视频描述文本的关键瓶颈。大多数描述文本管道仍然依赖于均匀采样,这种采样的计算成本很低,但与视觉内容无关。自适应帧采样从视频中选择信息最丰富的帧,但现有方法的计算成本仍然很高。我们引入了 PEEK,这是一种高效的动态帧采样方法,它将描述文本条件帧相关性排名从更强的教师模型提炼为仅对视觉内容进行操作的轻量级时间模型。在 ActivityNet Captions 和 MSR-VTT 上,PEEK 在所有评估的下游视觉语言模型中都优于最先进的方法,为大多数帧预算获得了最佳 CIDEr,特别是在仅选择一两个帧时,在 ActivityNet Captions 上的 16 个配置中赢得了 14 个。 MSR-VTT 上的零样本,它在低帧预算下传输效果最好,而随着时间覆盖和视觉多样性变得越来越有竞争力,四帧和八帧的结果更加混合。与最近的自适应基线相比,PEEK 在低预算情况下更准确,也更高效:它仅增加了描述文本时间 $5.2\%$,而 CSTA 为 $65.4\%$,MaxInfo 为 $211.9\%$。我们在 https://github.com/momentslab/peek 发布了我们的代码和预训练的检查点。