论文

观看合成视频:将跨模态表示与视觉合成相结合,实现零镜头视频字幕

Watching Synthetic Videos: Aligning Cross-modal Representations with Visual Synthesis for Zero-shot Video Captioning

模型训练监督微调与指令调优

摘要

纯文本训练是零镜头视频字幕中的一种流行范例,其中视频分布在训练期间不可用于模型,导致训练(纯文本)和推理(纯视频)之间存在跨模式差距。以前的作品试图通过简单的线性变换来弥补这一差距。然而,文本和视频之间固有的差距使得跨模态表示空间对齐不足,导致句子不准确。为了解决这个问题,我们提出了一种新颖的零镜头视频字幕框架(WSV),由两个训练阶段组成,它首先通过预训练的文本到视频生成模型生成相应的合成视频潜在表示。为了增强潜在表示的保真度,我们提出了一种能够弥合真实视频分布和合成视频分布之间差距的抛光器。随后,我们设计了一个提示器,将 GPT-2 置于经过修饰的潜在表示上,以在第二个训练阶段生成字幕。在推理过程中,输入视频由预训练的 3D 因果 VAE 进行编码,然后直接输入提示器,提示器进而引导 GPT-2 生成最终字幕。在 MSVD、MSR-VTT 和 VATEX 数据集上进行的实验结果表明,我们提出的方法在 B@4 和 CIDEr 指标上分别获得了 52 和 95.7 的分数。