论文

关闭验证循环:长段落详细音频字幕的自检字幕

Closing the Verification Loop: Self-Check Captioning for Long-Paragraph Detailed Audio Captioning

模型训练监督微调与指令调优

摘要

长段落详细的音频字幕需要对细粒度音频内容进行密集且忠实的描述,这对于当前的视听多模态语言模型来说仍然悬而未决。我们将这种失败归因于两个结构性问题。首先是数据匮乏,因为没有公共语料库共同提供长剪辑、段落标题和逐字记录保真度。第二个是生成模式失败,右音频和随机音频多项选择题 (MCQ) 准确率之间存在 44.8 到 46.4 个百分点的差距。我们在自检字幕 (SCC) 中解决了这两个问题,这是一个统一的框架,它将基于音频的问答实例化为每个生命周期阶段的验证原语。 SCC 产生三个工件。长段落音频字幕 50k (LACap-50k) 是一个包含 50,222 个剪辑的视听语料库,具有 491.5 个单词的字幕和事后自动语音识别 (ASR) 审核。层曲率监督 微调 (LC-SFT) 是第一个 同策略 监督 微调 方法,通过中间层证据对词元进行加权,其动机是我们对晚层语义熵崩溃 (SEC) 的识别。 SCC-Verifier 在推理时通过基于音频的自我回答在描述采样轨迹之间进行仲裁。在多个基准测试中,我们的系统在开源字幕机中达到了最先进的水平,并且与专有基准具有竞争力。我们发布 LACap-50k 来填补长段落详细音频字幕研究的资源缺口。