论文
AVCap:通过细节感知奖励强化音频-视频联合字幕
AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward
摘要
详细的音频-视频联合字幕对于多模态视频的理解和生成至关重要。然而,先前的工作受到三个主要限制:(1)缺乏具有细粒度视听联合字幕的高质量公共数据集; (2)依赖粗略奖励信号的强化学习方法; (3)缺乏在原子层面评估详细视听字幕的基准和指标。为了应对这些挑战,我们提出:(1)AVCap-100K,一个包含 100K 时间对齐、细节丰富的音频视频字幕的高质量数据集; (2) AVCap,一种通过 Detail-Aware GRPO (Da-GRPO) 优化的模型,在开源模型中实现了最先进的性能,并在多项评估中匹配或超越了专有模型; (3) AVCap-Bench 和 AVCap-Score,用于评估视听字幕中原子级细节的专门基准和指标。我们的代码、模型和数据集可在 https://huggingface.co/collections/Apryle/avcap 上获取。