论文

StrixAE:现实场景中复杂失真耦合下音频增强的智能代理

StrixAE: An Intelligent Agent for Audio Enhancement under Complex Distortion Coupling in Real-World Scenarios

模型训练强化学习

摘要

现实场景中的音频增强涉及复杂的失真耦合,需要个性化增强。现有的解决方案很难同时解决这两个问题。为了提高鲁棒性并在此类场景中实现自主操作,我们提出了 StrixAE,这是一种基于多模态 大语言模型 (MLLM) 的代理。 StrixAE 利用 MLLM 作为控制器来协调多个音频增强和个性化模型。为了进一步增强系统的鲁棒性、减少伪影并提高跨不同现实场景的泛化能力,StrixAE 通过两个阶段的过程进行训练:首先,CoT 在 AcoustBench 上监督 微调,以奠定基本推理和工具调用的基础;其次,音频感知强化学习(APRL),这是一种专门为音频恢复管道量身定制的奖励设计,可共同优化格式有效性、结构连贯性和感知质量。与通用 RL 微调 不同,APRL 引入了结构化奖励,强制执行可执行管道和逻辑部分排序,使代理能够在没有幻觉工具的情况下生成可靠、可解释的增强计划。基于真实世界的测试数据集,我们提出的方法优于大多数现有的开源和专有解决方案,在多个感知指标上实现了最先进的性能,并展示了强大的泛化鲁棒性。