论文

CodecCap:高保真编解码器启发的密集视频描述文本残差建模

CodecCap: High-Fidelity Codec-Inspired Residual Modeling for Dense Video Captioning

上下文与知识上下文工程

摘要

现有的视频描述文本方法很难平衡视觉保真度和冗余:整体描述文本很紧凑,但会丢失细粒度的证据,而分段描述文本可以提高覆盖范围,但会引入大量冗余。我们提出了 CodecCap,这是一种受编解码器启发的高保真密集视频描述文本框架。与视频编解码器类似,CodecCap 使用关键帧和残留描述文本表示视频。关键帧描述文本详尽地编码稳定的视觉上下文,而残留描述文本仅暂时捕获局部动作、运动和变化。这有效地保留了细粒度的视觉证据,同时减少了冗余的描述。为了量化描述文本的保真度,我们引入了 VidCapQA,这是一种描述文本然后 QA 基准,包含 14 个能力维度的 1,000 个问题。 VidCapQA 的结果表明,由强大的 VLM 直接生成的描述文本仍然会丢失许多视觉细节,这凸显了描述文本表示是一个关键瓶颈。实验表明,CodecCap 显着优于具有相同底层 VLM 的直接描述文本,这表明关键帧残留描述文本是高保真视频语言监督的一种方法。我们进一步使用 CodecCap 构建 CodecVDC-100K,这是一个具有锚点、残差、场景级和视频级监督的大规模密集描述文本数据集。