论文

探索用于跨同步和异步提示的统一目标语音提取的单一自回归 LLM

Exploring a Single Autoregressive LLM for Unified Target Speech Extraction across Synchronous and Asynchronous Cues

上下文与知识上下文工程

摘要

目标语音提取 (TSE) 通常为每个提示训练一个单独的提取器,而视觉提示系统通常需要损坏匹配训练才能在视觉帧损坏情况下保持鲁棒性。我们证明了一种自回归 LLM 主干 TSE-Omni 可以提供时间同步提示(嘴唇运动、共同语音手势)和异步提示(注册音频、文本)。 TSE-Omni 由下一个词元预测驱动:每一步都根据自己过去的输出预测目标语音语义词元,我们将其称为自注册,形成由注册提示(异步音频或文本,或短视觉前缀)初始化的连续目标语音上下文。这可以实现视听补偿:模型在完整时使用同步视觉效果,在视觉帧丢失时使用其词元历史记录。在干净的视觉效果下,TSE-Omni 将强大的判别性和生成性基线(VoxCeleb2 上的 SpeechBERTScore 0.81 和 LRS3 零样本上的 0.89)与更高的 DNSMOS 相匹配。在同一 VoxCeleb2 测试集上,在 2 秒的干净视觉启动后,删除剩余的视觉帧使 SpeechBERTScore 为 0.81。它在稀疏重叠和多说话者干扰下仍然可用,并支持流式推理。项目页面:此 https URL。