论文
SoundscapeAgent:面向可控合成与音频语言监督的Agent声景构建
SoundscapeAgent: Agentic Soundscape Construction for Controllable Synthesis and Scalable Audio-Language Supervision
摘要
我们提出了一种用于可控合成音频生成的代理音景构建框架,该框架明确了通常由单镜头文本到音频模型隐式处理的场景规划、源选择、时间布局和渲染步骤。基于 LLM 的代理将用户意图转换为可执行的场景计划,通过检索和按需生成获取资产,渲染可控的多事件混合,并导出对齐的场景元数据。该框架还通过用户引导的工具选择和可编辑的场景计划支持人机交互。这些组件共同提供了一种可检查且可重用的方法来实现可控的音景合成和可扩展的音频语言数据构建。听众研究和客观指标证明了相对于文本到音频基线的竞争性生成性能,而使用代理生成的数据训练的模型在下游音频推理中始终优于纯真实基线。代码、演示和听力测试结果可在 https://haozhang6720.github.io/SoundscapeAgentDemoPage/ 获取。