论文
持久故事和互动世界的远视视听生成
Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds
摘要
视频生成正在从孤立的剪辑发展到长篇叙事和交互式世界,要求模型保留身份、遵循用户控制并在长程生成轨迹中保持稳定。我们采样轨迹 JoyAI-Echo-1.5,这是一个统一的视听生成系统,具有两个专用变体。长视频变体引入了可组合的交叉镜头记忆,可以聚合多个先前镜头的视觉证据和来自语音过滤的全镜头音频的说话者线索,从而在文本、图像和记忆调节的灵活组合中实现持久的角色外观和声音身份。世界模型变体将异构导航输入转换为校准的公制 6-DoF 相机轨迹,并通过几何感知调节路径将其注入,从而实现跨灵活视点的与控制器无关的交互。为了支持高效的长视野生成,我们在自生成的卷展上使用渐进式教师强制以及短和长视野自梯度强制,将双向视听主干转换为因果几步生成器。实验证明在两种设置下都有很强的性能。 JoyAI-Echo-1.5 在跨镜头一致性、视觉质量、文本对齐和语音保真度方面实现了对现有长视频基线的改进。其世界模型变体在WBench上排名第一,平均得分为81.7,并在SANA-WM-Bench上实现了领先的视觉质量和长视野持久性。总之,这些结果表明,记忆、几何控制和采样轨迹感知训练为生成连贯的故事和不断发展的互动世界提供了实践基础。项目页面:https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/。