论文

DiVA:通过视频模型实现交互式数字生活模拟

DiVA: Enabling Interactive Digital Life Simulation via Video Models

应用与实践内容创作

摘要

我们推出 DiVA,这是一款深度互动的数字生活模拟器,开创了数字角色世界中长期、开放式互动体验的新范例。 DiVA 的架构将多模态大型语言模型 (MLLM) 作为路由器与精心设计的堆叠视频管道配对,以实现与动作和音频响应的无缝、多轮交互。为了保持连续性并避免退化,我们将生成建模为一个由三部分组成的耦合系统:等待视频、动作视频以及它们之间的过渡。这些转换由我们的锚定视频连续 (AVC) 模块进行严格处理,该模块可将角色恢复到稳定状态以防止性能下降。通过对前一个动作视频片段的信息进行编码,AVC 可确保平滑过渡,显着减少当前视频过渡方法中常见的摄像机抖动和不一致问题。这种设计还可以实现复杂的姿势变化(例如,从坐到站),这对于音频驱动模型来说通常是困难的。这些系统设计共同确保了扩展体验的高保真度、一致性和动态性。为了验证我们的管道设计,我们通过用主流的长视频、连续和插值方法替换我们的核心生成模块,将我们的系统与替代方案进行全面比较。我们进一步分析了三阶段设计、锚状态选择、过渡自然性、空间对齐和质量延迟权衡的必要性,并将与其他长格式音频驱动化身模型的比较扩展。结果证实 DiVA 在保持长期视觉质量和真实感方面具有明显优势,验证了其作为可持续交互式模拟的有效性。