论文
视频 = 世界 + 事件流
Video = World + Event Stream
摘要
我们推出了 Wan-Streamer v0.3,它在单一组织视图下重新构建了我们的原生流媒体交互模型:视频是一个世界加上一个事件流。世界是视频展开的持续上下文,包括环境、场景、主体、环境声学条件、语音特征和其他相对稳定的条件。事件流是该世界中随时间变化的一切,包括场景或环境变化、主体行为、语音和其他声音。这产生了针对大量真实视频的通用预训练任务:给定一个世界和传入输入,预测世界如何实时移动、变化和响应。由此产生的能力可以专门用于一系列广泛的实时下游任务。我们在实时全双工视听交互上实例化它,其中事件流是代理的语音和自由形式的行为。从功能上讲,该模型的多模态理解过程类似于视觉-语言-动作:它将多模态用户输入映射到语言形式的语音和行为动作。 Wan-Streamer v0.3 保留了 v0.2 的操作点:25 FPS 的 640x368 视频、160 毫秒的流媒体单元、大约 200 毫秒的模型端响应延迟以及在 350 毫秒的双向网络预算下大约 550 毫秒的总交互延迟。