论文

审核已知任务音频的生成音频调用-LLM Evaluatio

Auditing Generative Audio Calls for Known-Task Audio-LLM Evaluatio

模型评测评测方法与指标

摘要

通常通过询问波形提示是否优于自动语音识别 (ASR) 转录来评估语音和音频 LLM。对于已知的封闭集任务,这种比较合并了两个因素:获取声学证据和调用生成音频模型的需要。我们将这种区别评估为受控的呼叫决策问题。对于每个示例,策略选择保留转录标签、使用来自对比语言音频预训练 (CLAP)、音频频谱图 Transformer (AST) 或 WavLM 的编码器证据,以及调用 Qwen2-Audio、Qwen2.5-Omni 或 MOSS-Audio;果断的消融消除了所有生成操作,同时保持选择器和开发协议固定。在 VocalSound 上,仅转录表示的准确度达到 0.296,因此对于该标签集来说是不够的。然而,在没有生成音频呼叫的情况下,受监督的 CLAP 和 WavLM 控制达到 0.850 和 0.854。具有生成操作的选择器使用 12.5% 的调用达到 0.925 的准确度,而匹配的无调用选择器的准确度为 0.921(配对差值 0.004;95% CI [-0.025, 0.033],包括零)。协议和堆叠功能改进了较弱的选择器,但无法击败最强的无调用控制。对于已知任务终点值语句,相关量是在使用转录本和编码器证据后生成调用的边际值。