论文
使用 大语言模型 进行少样本和伪标签引导语音质量评估
Few-Shot and Pseudo-Label Guided Speech Quality Evaluation with Large Language Models
摘要
在本文中,我们介绍了 GatherMOS,这是一种新颖的框架,它利用 大语言模型 (LLM) 作为元评估器,将不同的信号聚合成质量预测。 GatherMOS 将轻量级声学描述符与来自 DNSMOS 和 VQScore 的伪标签集成在一起,使 LLM 能够对异构输入进行推理并推断感知平均意见得分 (MOS)。我们进一步探索了零样本和少样本上下文学习设置,表明零样本 GatherMOS 在不同条件下保持稳定的性能,而当支持样本与测试条件匹配时,少样本指导会产生巨大的收益。 VoiceBank-DEMAND 数据集上的实验表明,在有限的标记数据条件下训练时,GatherMOS 始终优于 DNSMOS、VQScore、朴素分数平均,甚至基于学习的模型(例如 CNN-BLSTM 和 MOS-SSL)。这些结果凸显了基于 LLM 的聚合作为非侵入式语音质量评估的实用策略的潜力。