论文
AudioMap:用于时间感知密集音频字幕的完形填空和选择强化学习
AudioMap: Cloze-and-Choice Reinforcement Learning for Time-Aware Dense Audio Captioning
摘要
时间感知密集音频字幕 (TDAC) 旨在生成具有精确时间边界(时间感知)的音频的多个细粒度属性(密集)。现有方法很难实现这两个目标,并且主要依赖于有监督的 微调,从而产生次优性能。虽然强化学习(RL)显示出希望,但将其应用于 TDAC 面临两个主要挑战:(1)现有奖励过于粗略,无法以细粒度的方式监督多事件、多属性和多关系描述; (2)时间监督对于自由格式的字幕来说是困难的,其中灵活的事件时间表达使得可靠的事件时间对应具有挑战性。为了应对这些挑战,我们提出了 AudioMap,这是一种新颖的基于 RL 的 TDAC 框架,它转向统一的完形填空和选择奖励范式。具体来说,我们引入了具有不对称分层评分机制的证据充分奖励(ESR),以提高跨不同声学维度的细粒度准确性和描述丰富性。此外,我们设计了事件条件时间奖励(ECTR),通过时间 IoU 将时间戳结构性地绑定到事件语义,并辅以双课程学习策略来促进训练过程。最后,为了支持这项任务,我们构建了第一个时间感知的细粒度音频字幕数据集 AudioMapCap-44K,其中包含 44K 仔细注释的字幕。跨不同基准的大量实验表明,AudioMap 在开源模型中实现了最先进的 (SOTA) 性能,并提供了相对于专有模型具有竞争力或卓越的结果。项目页面和版本更新可在 https://github.com/ryysayhi/AudioMap 上获取。