论文
SURE-Voice:语音中语音证据过滤的前端基线 LLM
SURE-Voice: A Front-End Baseline for Speech-Evidence Filtering in Speech LLMs
摘要
语音语言模型(语音 LLM)可以从不包含可用语音证据的音频中生成合理的输出。我们将这种失败作为预生成支持估计问题来研究,并提出了 SURE-Voice,这是一个 无需训练 前端,它在调用语音 LLM 之前决定音频提示是否包含可理解的语音证据。我们使用 640 个示例的 SURE-Core 分割和源自 120 个 LibriSpeech 源话语的 1,920 个示例的 SURE-扩展分割来构建 SURE-Challenge。使用一个固定操作点,能量屏幕加上 Whisper 词元置信度将六个非简并语音 LLM 主干网的保留扩展测试的不受支持的精度从 0.000--0.133 提高到 0.919,而受支持的精度仍然是 0.919--0.970,下游调用从 480 下降到 287。 500 剪辑 ESC-50理智集在真实环境音频上显示出相同的模式,其中声音非语音作为残余故障模式。重叠诊断表明源归因与语音证据过滤仍然是分开的。证据支持受控基准基线和面向部署的分析;它没有建立对语义可回答性、增益变化或自然对话的普遍鲁棒性。