论文

Audio-Oscar:用于复杂音频场景生成、编排和细化的多代理系统

Audio-Oscar: A Multi-Agent System for Complex Audio Scene Generation, Orchestration, and Refinement

智能体系统Agent 协作

摘要

近年来,音频生成在文本转语音(TTS)、文本转音频(TTA)和文本转音乐(TTM)等任务中取得了重大进展。然而,从复杂的音频场景描述生成长格式且可控的音频仍然是一个重大挑战,因为此类场景通常需要协调的语音、音效、音乐、歌曲、时间结构和后期制作。在这项工作中,我们引入了 \textbf{Audio-Oscar},一个用于从复杂描述生成音频的多代理框架。 Audio-Oscar 协调一组专业代理,每个代理负责音频场景的不同方面,包括角色建模和语音设计、语音生成、细粒度时间线规划、模型选择、非语音生成和音频后期制作。音频奥斯卡进一步融入了反馈驱动的改进。此外,为了解决缺乏合适的基准来评估复杂音频场景描述的音频生成的问题,我们构建了 \textbf{ASG-Bench},这是一个音频场景生成基准,包含与参考音频和纯文本场景描述配对的场景描述。每个场景都用目标音频事件和时间语句进行注释,以评估生成的音频是否忠实地实现了所需的场景内容和时间结构。实验结果表明Audio-Oscar可以有效生成匹配复杂场景描述的音频。项目示例可在 https://audiooscar.github.io/ 获取。我们的代码可在 https://github.com/ziye26/Audio-Oscar 获取。