论文
全模态密集视频视频描述的并行自回归解码
Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning
摘要
密集视频视频描述旨在生成视频事件的基于时间的描述,有利于事件级视频的理解和生成。在该领域,自回归视频 大语言模型 因其强大的生成和跨模式建模能力而成为流行的范例。然而,随着视频长度和事件密度的增加,在逐个词元范式下生成密集视频描述严重限制了推理效率并阻碍了可扩展性。在这项工作中,我们提出了一种并行自回归框架,它不仅提高了生成效率,而且还增强了基于时间的视频描述性能。我们的主要见解是利用时间上不同事件之间的弱局部依赖关系来重构因果依赖图,从而实现无损并行生成。具体来说,具有弱跨事件依赖性的词元可以并行解码,而每个事件内紧密耦合的词元保留顺序解码以保持局部语义一致性。为了实现这一见解,我们引入了无损并行解码的两个关键组件:(1)潜在的全局规划机制,自动学习事件级结构并生成编码全局事件间因果关系的紧凑词元,同时自适应聚合事件级视听语义,指导后续的依赖关系重组和并行解码; (2)事件分解并行解码机制,有效平衡局部焦点与全局事件间感知。各种基准的实验表明,我们的方法在全模态事件时间定位和视频描述方面的效率和性能方面具有明显的优势。项目网站:https://github.com/showlab/PadCaptioner。