论文
动态声源的时空音频语言建模
Spatio-Temporal Audio Language Modeling for Dynamic Sound Sources
摘要
声音事件是具有语义身份、位置和轨迹的实体,但当前的音频语言模型通常将剪辑推理为全局事件内容。相反,声音事件定位模型随着时间的推移跟踪源方向,但为语言推理提供有限的语义覆盖。为了解决这一差距,我们引入了 ST-AudioQA,这是一个时空音频 QA 数据集和基准,它是根据静态和移动声源的一阶立体声 (FOA) 渲染构建的。每个场景都提供源身份、活动、方向、距离和运动元数据,从而实现密集的轨迹监督和有关声音、位置、移动方式以及源如何关联的问题。我们进一步提出了 ST-Audio Encoder(一种时间解析的 FOA 音频编码器,可学习事件语义和源轨迹)和 ST-AudioLM(将编码器中的音频标记连接到 LLM 以进行时空音频 QA)。实验表明,这种表示改进了语义本地化权衡,并比静态空间和面向本地化的基线产生更强的推理性能。