论文
BackgroundMellow:用于叙事驱动的丰富电影音景生成的多模态内聚框架
BackgroundMellow: A Multi-Modal Cohesive Framework for Narrative-Driven Rich Cinematic Soundscape Generation
摘要
为长文本叙述生成沉浸式、同步的电影音频仍然是多模式人工智能中的一个重大挑战。虽然当前的文本到音频 (TTA) 框架成功地合成了孤立的声音效果,但它们在叙事衔接、时间对齐和电影情感深度方面遇到了困难。我们提出了BackgroundMellow,一个将故事到音频生成视为精确编排和信号处理问题的框架。该框架无需 真值 即可通过主专家代理架构启用,该架构将文本分解为精确的多层音频提示,使用合适的专家模型生成每个类别的声音,并叠加音景以创建统一且对齐的音频片段。我们的流程基于用于环境合成的 Tango2 潜在扩散模型以及从专业音轨中挖掘的新颖电影 BGM 检索器 构建。为了自动化声音混合过程,我们使用基于 NLP 的模块,该模块根据叙述时间线预测精确的音频参数,例如开始时间、持续时间和相对响度。我们进一步根据经验评估并展示了所提出的框架的有效性,该框架利用最近邻检索针对 YouTube 电影预告片的精选数据集来测量时间同步、覆盖范围和频谱丰富度。