论文
Wan-Streamer v0.1:端到端实时交互基础模型
Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models
摘要
我们推出了 Wan-Streamer,这是一种原生流媒体、端到端交互基础模型,专为实时、低延迟、全双工视听交互而设计。 Wan-Streamer 将语言、音频和视频无缝建模为单个 Transformer 中的输入和输出,其中序列表示为交错的视觉、音频和文本输入标记以及视觉、音频和文本输出标记,并通过增量流的块因果注意力进行协调。与依赖单独的 VAD、ASR、语言、TTS、音频驱动动画或视频生成模块的级联交互系统不同,Wan-Streamer 不依赖外部语言、语音、化身或视频生成模块:感知、推理、生成、响应定时、回合管理和跨模态同步在一个统一模型中共同学习,从而减少管道延迟和错误累积。为了支持自然的视听响应能力,我们围绕流媒体能力重新设计了整个堆栈,包括因果编码器、因果解码器、块因果注意力和低延迟多模态词元调度,使流媒体单元在 25 fps 下的传输时间短至 160 毫秒。 Wan-Streamer 与 350 毫秒的双向网络延迟相结合,可实现约 200 毫秒的模型端响应延迟和约 550 毫秒的总交互延迟,支持亚秒级双工视听通信。这些结果将 Wan-Streamer 定位为低延迟流交互的统一、端到端、多模式交互基础模型。