论文

MMAE:大规模多任务音频编辑基准

MMAE: A Massive Multitask Audio Editing Benchmark

模型评测基准与评测资源

摘要

我们推出了 MMAE,一种大规模多任务音频编辑基准,作为第一个专为基于通用指令的音频编辑而设计的综合评估测试平台。在向智能创作转变的推动下,交互式编辑已从图像领域的 Nano-banana 2 和视频领域的 Gemini-Omni 等模型所开创的视觉领域迅速扩展到音频领域。然而,当前的评估基础设施严重滞后,仍然高度分散,并且仅限于特定的子域或基本操作。与范围有限的现有基准不同,MMAE 扩展到广泛的现实场景,涵盖 7 种不同的音频模式,包括声音、语音、音乐及其混合。此外,我们建立了涵盖 6 个任务复杂度级别的综合分类法,从基本修改到多跳推理和多轮编辑、2 个粒度级别和 8 种不同的操作类型。 MMAE 通过人工与代理协作精心策划,包含 2,000 个高保真样本,并配有开创性的基于评分标准的评估框架。通过将自由形式的任务分解为 17,741 个可验证的标准,这种基于评分标准的稳健范式能够对指令遵循和上下文一致性进行精确、多维的评估。我们对领先模型的广泛评估表明,当前系统距离实现可靠的编辑还很远。引人注目的是,在复杂的混合模态任务中,精确匹配率 (EMR) 始终低于 5%,甚至骤降至绝对 0%,暴露了精确执行和结构稳健性方面的关键瓶颈。我们希望 MMAE 能够成为智能创作社区未来发展的催化剂,为下一代音频编辑系统提供清晰的诊断路线图并建立标准化、持久的评估范式。