论文
JenBridge:跨场景转换的自适应长视频配乐
JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions
摘要
我们解决了生成高保真长音轨的挑战,这些音轨在场景转换中保持连贯。现有的人工智能音乐系统主要针对短小、孤立的片段而设计,缺乏保证叙事连续性的机制。我们推出 JenBridge,这是一个用于自适应长格式视频配乐的模块化且可解释的框架,可确保高保真音频生成和过渡自然度。核心架构是基于 Transformer 的生成模型,采用流匹配目标进行训练,遵循两阶段范式:对大规模文本音频语料库进行预训练以建立强大的音乐先验,然后通过双文本视觉调节适应视频领域以实现精确的跨模式对齐。至关重要的是,为了在不同的场景变化中实现长形式的连贯性,JenBridge 采用了一种新颖的自适应过渡机制。该系统具有过渡风格的多功能工具包,包括生成过渡方法,并独特地采用了 大语言模型 (LLM) 代理,充当导演,为每个叙事转变智能地选择最合适的过渡。为了严格评估这项任务,我们提出了 LVS 基准,这是一个新的基准,其中包括精心策划的数据集和新颖的评估指标,重点关注整体和过渡感知评估。对所提出的基准进行的大量实验表明,JenBridge 在客观和主观指标方面都显着优于现有方法,特别是在过渡自然性和整体叙事连贯性方面。 JenBridge 代表了朝着全自动、专业品质视频配乐迈出的重要一步。