论文

使用视觉语言模型对教学视频进行多模态生成式摘要

Multimodal Abstractive Summarization of Instructional Videos with Vision-Language Models

应用与实践内容创作

摘要

多模态视频摘要需要在语义上与语言生成保持一致的视觉特征。传统方法依赖于为对象分类训练的 CNN 特征,这些特征将视觉概念表示为与自然语言不相符的离散类别。我们提出了 ClipSum,一个利用冻结的 CLIP 视觉语言特征、显式时间建模和维度自适应融合进行教学视频摘要的框架。 CLIP 在 4 亿图像-文本对上的对比 预训练 产生了在语义上与文本解码器生成的语言概念一致的视觉特征,从而弥合了表示级别的视觉-语言差距。在 YouCook2 上,ClipSum 在维度降低 4 倍(512 vs. 2048)的情况下,ROUGE-1 达到了 33.0%,而 ResNet-152 达到了 30.5%,这表明语义对齐比特征容量更重要。 Frozen CLIP (33.0%) 超过了微调 CLIP (32.3%),这表明保留预训练的对齐比特定于任务的适应更有价值。 https://github.com/aqeeelmirza/clipsum