论文

先看后合成:VLM 引导的弱监督密集视频字幕的转换事件发现

Seeing Before Synthesizing: VLM-Guided Transition Event Discovery for Weakly-Supervised Dense Video Captioning

模型训练合成数据

摘要

弱监督密集视频字幕旨在定位和描述未经修剪的视频中的多个事件,而每个视频仅给出一组有序的事件级字幕。最近的工作通过 LLM 合成辅助过渡字幕,以提供额外的视觉语言对齐,但这些字幕缺乏视觉基础,并且被严格分配到固定位置和持续时间的每个事件间间隙。为了解决这些问题,我们提出了先见后综合(SBS),这是一个框架,仅在必要时自适应地提供基于视觉的语言指导。利用 VLM,我们为事件间间隙生成帧级叙述,并检测它们之间的语义变化的转换。对于识别的转换,我们然后通过将时间中点与语义变化点混合并选择最大化视觉语言对齐的宽度来细化事件间时间掩模。 ActivityNet Captions 和 YouCook2 上的实验展示了字幕和本地化方面最先进的性能。