论文

Wan-Streamer v0.2:更高的分辨率,相同的延迟

Wan-Streamer v0.2: Higher Resolution, Same Latency

模型推理分布式推理

摘要

我们推出了 Wan-Streamer v0.2,这是本地流媒体、端到端视听交互模型的延迟保留升级。 v0.2 保留了 v0.1 建模公式,但将交互式输出流从 192x336 提高到 640x368,同时在 25 FPS 下保留约 200 毫秒的模型端信号到信号延迟。更高分辨率的流支持基于场景的中镜头代理,其姿势、目光、手、附近物体和本地场景布局在实时对话期间保持清晰。为了支持更大的视觉流而不增加用户可见的延迟,v0.2 将 thinker 保留为单 GPU 低延迟路径,用于流感知、构建生成缓存的短语言/状态 Transformer 传递以及最终解码。执行者成为昂贵的下一个单元潜在代的多 GPU Ulysses 式上下文并行组。每个执行者等级将传入的 K/V 写入预分片的本地缓存中。长的高分辨率潜在视频序列被跨级分割以进行去噪,并通过 Ulysses 通信进行收集,而更短的音频潜在序列是在没有序列分片的情况下生成的。在这种分裂中,思考者的语言/状态计算仅作为 K/V 调节到达执行者,因此不需要在执行者组内传达单独的语言序列。这将额外的硬件集中在视觉生成上,同时保留了紧凑的思考者与执行者边界,当包括 350 毫秒的双向网络预算时,将总远程交互延迟保持在大约 550 毫秒。