论文
SpeechEditBench:用于指令引导语音编辑的双语多属性基准
SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing
摘要
指令引导的语音编辑需要一个模型来修改指定的语音属性,同时保留非目标特征。尽管 Speech 大语言模型 (Speech LLM) 取得了快速进展,但对该功能的系统评估仍然具有挑战性,因为现有基准测试分散在各个独立的编辑任务中。为了弥补这一差距,我们引入了 SpeechEditBench,这是一种用于指令引导语音编辑的双语多属性基准。 SpeechEditBench 包含七个原子编辑任务,以及在单个指令中集成多个操作的组合编辑任务。我们提出了一种基于锚的评估协议,分别评估目标属性的编辑成功和非目标语言内容的保存,从而得出三个指标:目标成功、保存成功和联合成功。使用此基准,我们评估主流语音 LLM 和专业语音编辑系统。结果揭示了三个关键发现:(1)没有一个模型在所有编辑维度上都表现良好; (2) 闭源 Speech LLM 总体表现优于开源模型; (3) 构图编辑提出了重大挑战,即使是最先进的模型也难以取得较高的联合成功。 SpeechEditBench 提供了严格的诊断框架来识别 Speech LLM 中的瓶颈,从而促进具有更精确的指令引导编辑功能的下一代模型的开发。数据和代码可在 https://github.com/daxintan-cuhk/SpeechEditBench 获取。