论文

BEST-RQ-2:上下文化然后预测,自监督音频表示的两步方法

BEST-RQ-2: Contextualize-Then-Predict, a Two-Step Approach for Self-Supervised Audio Representations

模型训练预训练

摘要

自我监督学习可以实现跨领域和任务传输的音频表示。我们提出了 BEST-RQ-2,这是 BEST-RQ 的演变,它保留了基于冻结随机投影的离散目标,同时引入了两步上下文化然后预测预训练方案。 ViT 上下文编码器仅处理未屏蔽的频谱图区域,而轻量级预测器则推断屏蔽区域的目标;预训练后预测器被丢弃。用 ViT 替换原来的 Conformer 编码器可以跨领域改变性能,略微降低语音性能,同时改善音乐和环境声音,平均得分相当。主要的改进来自于将屏蔽预测分解为单独的上下文化和预测阶段。在 X-ARES 和 XARES-LLM 基准测试中,BEST-RQ-2 在整体传输方面始终优于单阶段基线,同时保持推理计算不变。代码和模型检查点是公开的。