论文
VoxAudio:通过多奖励自回归流匹配进行发声音频合成
VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching
摘要
发声音频合成是生成音频的任务,其中将可理解的语音嵌入到环境音景中,支撑着播客制作和视频配音等应用。现有的文本转音频 (T2A) 系统要么将引用的语音简化为难以理解的杂音,要么将其委托给具有事后混合的单独 TTS 模型,这会丧失对语音何时发生以及如何与场景交互的控制。我们提出了 VoxAudio,一种因果自回归流匹配模型,它从三个互补的方面解决了这个问题。在架构级别,具有独立的每块噪声水平的块级因果分解让音频通过滑动窗口流推理与可变目标持续时间的 KV 缓存发出;为了能够在任意块粒度上进行推理,我们进一步使用随机块边界对模型进行预训练。在偏好层面,多奖励负感知微调(NFT)联合优化语义保真度、语言准确性、美学质量和时间基础。在数据层面,为了提供对语音内容缺失的监督,我们构建了 VoxCorpus,一个大型语料库,其字幕引用了带有时间间隔的嵌入式语音的逐字记录,以及 VoxBench,一个带有时间基础度量的间隔注释基准。对通用音频、语音和统一发声音频的四个基准进行的实验验证了 VoxAudio 的有效性和效率。我们的代码和演示可在 https://voxaudio.github.io 上获取。