论文
StarTSE:通过自回归语言模型的分块交错拼接实现流式目标说话人提取
StarTSE: Towards Streaming Target Speaker Extraction via Chunk-wise Interleaved Splicing of Autoregressive Language Model
摘要
虽然生成模型为目标说话人提取 (TSE) 设定了新的基准,但它们对全局上下文的固有依赖阻碍了在实时应用程序中的部署。由于训练和流推理之间的严重不匹配,直接适应流场景通常会导致灾难性的推理性能下降。为了弥补这一差距,我们提出了第一个专为流式 TSE 定制的自回归 (AR) 模型。我们的方法引入了分块交错拼接范式,确保高效且稳定的流推理。为了确保提取的语音片段之间的一致性,我们设计了一种历史上下文细化机制,通过利用历史信息来减轻边界不连续性。 Libri2Mix 上的实验表明,虽然 AR 生成基线在低延迟时表现出性能下降,但我们的方法保持了 100% 的稳定性和卓越的清晰度。此外,我们的流媒体结果可与甚至超过离线基线相媲美。此外,我们的模型在消费级 GPU 上实现了 0.248 的实时因子 (RTF)。这项工作提供了经验证据,证明 AR 生成骨干网通过分块交错拼接范式对于延迟敏感的应用程序是可行的。