论文
TS-VAP:以对话预测辅助流式音视频目标语音提取
Dialogue-Based Streaming Audio-Visual Target Speaker Extraction with Predictive Dialogue Information
摘要
在面对面的实时通信中,说话代理必须通过自然停顿、轮流和附和反馈(通常是在背景串扰中)来跟踪目标说话者。然而,大多数目标说话人提取(TSE)研究依赖于完全或稀疏重叠的模拟混合物,而忽略了真实对话的轮流。因此,据我们所知,我们引入了在线视听 TSE (AV-TSE) 的第一个基准,该基准是通过与独立第三方干扰的完整双人交互构建的。观察到从语义、声学和面部线索预测即将发生的活动有利于在线 AV-TSE,我们提出了一种基于 LLM 的目标说话人语音活动投影 (TS-VAP) 模块。与具有独立说话者通道的传统 VAP 不同,它利用语音大语言模型的语言和会话知识,直接从重叠的混合中预测目标和会话伙伴的未来活动,并使用此预测来指导低延迟分离器。我们进一步将这种预测上下文与历史和同步说话者上下文结合起来。实验表明,TS-VAP 持续改进了跨多个 AV-TSE 主干的流提取,并且进一步结合历史、同步和预测上下文,可以在真实 AV 对话上产生近 1 dB 的增益。项目页面:https://jjjjiaozi.github.io/TS-VAP/。
