论文
超越声学前缀:对基于 LLM 的多说话者语音识别的序列化声学存储器的持久访问
Beyond Acoustic Prefixes: Persistent Access to Serialized Acoustic Memory for LLM-Based Multi-Talker Speech Recognition
摘要
大语言模型 (LLM) 为序列化输出训练 (SOT) 提供强大的语言先验,但基于 LLM 的多说话者 ASR 会随着重叠说话者数量的增加而大幅下降。传统系统主要通过初始投影的混合前缀来暴露声学证据,要求解码器在整个自回归生成过程中间接保存和恢复与说话者相关的信息。我们首先检查是否可以通过使用离散联结时间分类(CTC)标记、混合标记-声音提示和连续说话者特定表示来丰富静态前缀来解决此限制。结果表明,仅靠声学内容并不能完全解决调节瓶颈。因此,我们将基于起始点的序列化从输出目标扩展到声学调节路径,并引入对 SOT 对齐的序列化声学存储器的持久解码器端访问。特定于说话者的表示按话语开始顺序组织并保留为外部声学记忆,而传统的混合前缀提供了补充的全局调节路径。 LLM 层通过门控残差交叉注意力在整个生成过程中查询此内存。我们进一步引入了第二个适应阶段,该阶段联合将低秩更新应用于声学检索路径和选定的 LLM 自注意力投影。 LibriMix 上的实验显示相对于静态前缀提示的持续改进。这些结果表明,有效的基于 LLM 的多说话者 ASR 不仅取决于提供更丰富的声学表示,还取决于维持对根据序列化输出构建的声学证据的持久访问。