论文

STAM-ASR:具有记忆功能的说话人颞锚定,适用于多说话人 ASR

STAM-ASR: Speaker-Temporal Anchoring with Memory for Multi-Speaker ASR

摘要

自然对话对 ASR 来说,语音识别和说话者归因都面临挑战,因为说话者会随着时间的推移轮流、重叠和重新出现。我们提出了 STAM-ASR(Speaker-Temporal Anchoring with Memory),这是一个轻量级框架,可扩展已预训练的 AudioLLM 以用于多说话人 ASR。在不依赖外部分类系统的情况下,STAM-ASR 直接从中间 AudioLLM 特征中学习说话者活动和说话者感知表示。因此,提供明确的谁和何时提示来调制 AudioLLM 的语义表示,而无需明确的语音分离。 STAM-ASR 进一步维护固定大小的说话者和对话记忆,以跨回合携带互补的上下文。我们在 AMI、ICSI、LibriCSS 和 NOTSOFAR-1 上跨近距离、远场、重叠和跨域条件评估 STAM-ASR。我们报告的结果表明,说话者时间调节和记忆提供了互补的好处,而参考和预测的说话者活动之间的差距将稳健的说话者跟踪确定为一个关键的剩余挑战。