论文

LynnReal-Omni:面向智能体视觉工作流的原生多模态视频生成

LynnReal-Omni: Native multi-modal Video Generation for Agentic Visual Workflows

模型训练预训练

摘要

视频扩散模型是随机的且难以控制:精确的内容通常需要重复采样,但无法保证成功,而且长视域场景在外观、交互和时间连贯性方面会发生漂移。代理视觉创建提供了明确的参考、可编辑的 3D 场景或可执行的游戏状态以实现稳定的控制,但其本身并不能保证对象或角色的高保真度。将两者结合起来可以实现稳定、高质量的生成。为了实现这种组合,我们推出了 LynnReal-Omni,这是一个基于 32B 共享多模态扩散转换器构建的原生多模态视频生成框架,它统一了文本到视频、图像调节生成、参考引导生成、结构控制、编辑、降级视频恢复和长视频生成。它接受异构视觉输入,包括外观参考、可编辑的 3D 渲染和游戏录制,允许代理在统一模型中组合视觉条件。我们还训练了一个专用的 27B Flash 共享多模态扩散Transformer用于实时渲染。我们为视频清理、主题关联、多模态注释和对齐控制构建构建了系统数据管道,生成了多镜头视听片段的精选语料库,并引入了 MSAVP,这是一种 100 提示、20 度量的评估设计,可将指令遵循、生成合理性、视觉质量、时间行为和音频协调分开。 LynnReal-Omni-Flash通过模型和解码加速(包括轻量级VAE解码器)进一步降低推理成本;在一台 H100 上,22 帧 540p 视频的热生成和解码在使用 LynnReal-Omni 时需要 843 毫秒,在使用 Flash 时需要 377 毫秒。这些结果为实时流媒体视频生成提供了基础,使LynnReal-Omni成为代理视觉创作的统一、可控、高效的基础。