论文
研究基于基础模型的说话人二值化中的空间信息集成
Investigating the Integration of Spatial Information in Foundation-Model-Based Speaker Diarization
摘要
从多通道输入收集的空间信息已被证明可以改进会议处理任务,例如分类和源分离。同时,基于大型预训练单通道基础模型(例如 WavLM)提取的特征的二值化实现了最先进的性能。这项工作比较了将空间特征集成到基于基础模型的二化系统中的三种方法:波束形成器和单通道基础模型的级联、多通道基础模型以及下游网络对显式提取的空间特征的调节。结果表明,波束形成器前端甚至不利于重叠语音区域的二化性能,而通过调节实现了最佳性能,这表明结合显式空间特征是基础模型支持的二化的一种有竞争力的方法。该方法进一步进行了详细的误差分析,表明调节系统在很大程度上消除了仅使用光谱或仅使用空间特征时可能出现的误差。