论文
StreamChar:具有解耦编排的长视野流式字符音频-视频生成
StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration
摘要
角色动画的实时流式联合音频-视频生成需要生成器说出所请求的转录本,保持跨块的视觉标识,并在严格的播放预算内运行。这些要求很难同时满足:分块自回归生成会累积转录音频错位和视觉漂移,而低延迟所需的几个步骤 蒸馏 通常会降低空间多样性和时间质量。我们提出了 StreamChar,一个流框架,它将长范围编排与短窗口音频视频去噪分开。基于 LLM 的编排器使用转录和历史上下文来生成帧对齐的音频条件,联合音频-视频 DiT 通过参考和运动帧调节执行本地双向降噪。为了高效部署,我们使用两阶段 蒸馏 管道,首先压缩采样器,然后在在线块轨迹采样下微调学生。进度感知指针在轨迹采样训练期间将部分转录本与生成的音频对齐,而接收块内存提供持久的视觉锚点以减少长范围漂移。短剪辑和长视野协议的实验表明,StreamChar 在单个 H100 GPU 上实时运行,与最近的联合和音频驱动基线相比,在转录保真度、视听同步、视觉质量和流稳定性之间提供了有利的系统级权衡。