论文

AVSCap:协调音视频协同以实现全模态视频描述

AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning

模型训练强化学习

摘要

全模态视频描述不仅仅是将视觉描述与音频转录相结合:有用的描述必须描述视觉动作、语音、音乐和声音效果如何共同发展。现有的大型多模态模型通常在这个关系步骤上失败,将音频和视觉流视为松散耦合的观察,依赖于自动语音识别,并且未指定非语音及其与视觉事件的链接。我们提出了 AVSCap,一个以显式跨模式事件绑定为中心的视听描述框架。首先,我们构建了 AVSCap-130K,这是一个由解耦然后融合的管道生成的三模态训练语料库,该管道在组成有视听证据支持的全模态视频描述之前锚定视觉和听觉证据。其次,我们训练 AVSCap-7B,这是一个采用两阶段策略的 7B 描述生成器:受监督的 微调 建立基线能力,而样本高效的强化学习使用混合奖励来优化声学完整性和视听协同作用。我们的扩展分析表明,强化学习比增加 SFT 数据带来的收益更大。第三,我们介绍 AVSCapBench,这是一个基准测试,它将描述分解为视觉、音频和协同事件,并通过细粒度的事件回忆来评估它们。 AVSCapBench 和外部基准测试表明,AVSCap-7B 改善了非语音音频覆盖范围和跨模式绑定,在评估的开源模型中提供了最佳的整体性能。