论文

FD-VAD:流式全双工语音的语义端点检测

FD-VAD: Semantic Endpoint Detection for Streaming Full-Duplex Speech

模型训练参数高效训练

摘要

全双工语音交互中的自然轮流需要根据部分语音确定停顿是否反映了犹豫或完整的对话意图。声学语音活动检测缺乏这种语义信息,而基于级联 ASR 的端点引入了转录依赖性和额外的处理阶段。我们将语义端点检测制定为因果音频语言推理任务,并引入 FD-VAD,这是一种无 ASR 的流端点器,可将有界因果音频窗口直接映射到继续/停止决策。 FD-VAD 将冻结语音编码器与轻量级模态适配器和参数高效适应的语言模型相结合,使用最后一个块训练目标进行流推理。我们进一步引入置信门控端点承诺来控制中断与延迟,并引入以边界为中心的硬负采样来改进围绕模糊转弯边界的决策。在域内和会话评估中,FD-VAD 的性能优于强大的流式和非流式语义转向分类器,并在零样本设置下的 TurnBench 开发集 $0.853$(FP<=0.10)的资格系统中实现了最高的 EOT 召回率。这些结果表明,语义端点可以直接从流音频执行,无需中间 ASR 或对话状态跟踪。