论文
用于全体会议发言者分类的语音语言模型:功能和局限性
Speech Language Models for Full-Meeting Speaker Diarization: Capabilities and Limitations
摘要
语音语言模型 (SpeechLM) 的最新进展将大型语言模型与语音基础模型集成在一起,实现了语音处理任务的统一序列建模。然而,许多基于 SpeechLM 的说话人二值化 (SD) 方法与自动语音识别 (ASR) 紧密结合,并使用单词级指标进行评估,因此很难独立于 ASR 准确性来评估 SD 性能。在这项工作中,我们研究了 ESPnet-SpeechLM 作为基于词元的骨干,用于生成 SD 假设,将 SD 公式化为以声学输入为条件的结构化词元的自回归生成。我们系统地比较了两种输出表示:基于事件的表示,显式模拟说话者开启和偏移时间戳,以及基于帧的表示,预测帧级说话者活动。为了提供结构化的对话线索,我们进一步在输出序列中纳入辅助任务,包括语音活动检测、重叠语音检测和说话者回合计数。在多个会议数据集中,我们发现基于事件的表示比基于帧的表示产生更稳定和一致的 SD 输出。我们的分析表明,SpeechLM 生成的输出编码了有用的时间 SD 结构,但全会议 SD 仍然受到录音级发言者跟踪和重叠相关遗漏的限制。显式的说话人链接后处理大大减少了说话人的混乱,这表明基于 SpeechLM 的稳健 SD 需要持续的说话人跟踪和重叠感知生成。