论文

UnityShots:具有边界感知门控的内存驱动多镜头音频视频生成

UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating

应用与实践内容创作

摘要

生成连贯的多镜头视频需要结构化的交叉镜头内存。主题外观、场景背景和说话者身份必须在各个剪辑中保持一致。现有方法要么在固定长度序列上进行端到端训练,并且无法扩展,要么使用线性增长的内存库生成逐个镜头,要么在没有多镜头感知骨干的 LLM 规划器下编排预训练的生成器。我们推出了 UnityShots,这是一种基于 LTX-2.3 构建的内存驱动的多镜头音频视频生成系统,经过带注释的电影和音乐视频镜头的训练。视频流维护两个固定大小的槽,一个锚定到开头镜头的长期记忆 (LTM) 槽和一个保存前一个尾部的短期记忆 (STM) 槽,这两个槽在每次剪辑时都会由边界条件门进行更新,该边界条件门融合了视觉剪切概率和节拍跟踪器信号。音频流在每个镜头中注入参考说话人词元,以在不滑动音频库的情况下保留声音音色。通过 AdaLN 学习的离散剪切型先验成为过渡强度的推理时间控制旋钮。我们发布了包含200条跨文化多镜头序列的基准,涵盖六个民族地区和十种或更多语言,其中包含每个镜头的参考身份、参考音频和每个边界过渡标签。经过 I2V、T2V 和 R2V 调节模式的评估,UnityShots 在每个交叉镜头相干性指标上都领先于开源基线,并在多镜头轴上匹配最强的闭源系统。