论文
Baton:联合视频音频生成的显式语义蓝图
Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation
摘要
当前的开源扩散模型很难生成稳定且同步的视听内容,特别是在需要复杂语义推理的场景中。根本原因是现有方法依赖于现成编码器的粗文本嵌入来指导音视频去噪,这丢弃了细粒度语义,而且更重要的是缺乏共享的长期计划,导致不协调的去噪轨迹和脆弱的跨模态对齐。我们提出了 Baton,这是第一个将显式语义规划引入视频音频联合生成的框架。我们的主要见解是,用语义丰富、模态感知的计划标记来补充粗略的文本指导,在去噪之前进行联合推理和相互对齐,可以同时恢复细粒度的语义细节,并建立一个协调音频和视频去噪轨迹的共享蓝图。具体来说,Baton 首先引入了 VA-Planner,这是一种配备双语义对齐塔的多模态语言模型,其中可学习的查询交叉参与视频和音频特征,以生成一对语义对齐的视频和音频计划标记作为关键帧级蓝图。这些计划的词元通过交叉注意层注入到扩散主干中,提供与粗文本嵌入互补的时间时序对齐指导。由于计划标记不与扩散潜伏共享一对一的时空对应关系,因此我们进一步提出了相对语义 RoPE,这是一种相对位置编码,它将计划标记和潜伏映射到共享时空坐标系中,使每个潜伏能够准确地关注其位置对应的语义线索。基准实验从定性和定量两个方面证明了 Baton 的有效性。