论文
通过音频描述对齐对通用音频表示进行语义细化
Semantic Refinement of Universal Audio Representations through Audio-Description Alignment
摘要
通用音频表示必须保留声学细节,同时使高级概念可以跨语音、音乐、环境声音和不同容量的下游模型访问。我们通过在 BEST-RQ、重建和 CTC 的基础上添加音频描述对齐来研究声学预训练编码器的语义细化。我们比较匹配的控制、打乱的描述和正确配对的轨迹,以区分正确的对应关系和额外的对比目标。每个端点都被冻结并使用时间平均线性探针和序列感知的 LLM 读数进行评估,测试精炼的信息是否可以直接访问并且对于更强大的模型仍然有用。在三对种子中,正确的对齐将线性探针的域平衡分类提高了 4.66 个点,使用序列感知 LLM 提高了 2.59 个点,每个域都有积极的变化。正确的配对占线性探头增益的 87%,而 LLM 在字幕方面显示出最明显的对应特定优势。密集的声学目标在两种读数下提供互补的增益。在共享评估器下,单独的 24 层延续仍然与领先的公共编码器具有竞争力,支持超出受控研究的配方。