论文
Vidu S1:实时交互式视频生成模型
Vidu S1: A Real-Time Interactive Video Generation Model
摘要
我们推出Vidu S1,一种支持数字角色语音控制的实时交互式视频生成模型。用户可以随时通过语音指令控制视频生成内容。 Vidu S1支持无限长度的实时视频生成,不会出现模糊、漂移或视觉失真的情况。 Vidu S1 采用 TurboDiffusion 和 TurboServe 构建,在普通消费级 GPU 上以高达 42 FPS 的速度输出 540p 实时视频。用户可以上传真人、动漫、宠物的自定义图片,并选择不同的语音音调以获得个性化体验。实验表明,Vidu S1在所有测试指标上均实现了最佳性能,同时完全满足实时推理要求。可在 https://vidu.com/vidu-stream 上获取可玩的在线演示。