论文

OmniWeaving:通过自由形式的构图和推理实现统一视频生成

OmniWeaving: Towards Unified Video Generation with Free-form Composition and Reasoning

应用与实践内容创作

摘要

虽然像 Seedance-2.0 这样的专有系统在全能视频生成方面取得了显着的成功,但学术研究界却远远落后:其大多数模型仍然严重分散,并且现有的少数统一视频生成努力仍然难以将不同的任务无缝集成到一个框架内。为了弥补这一差距,我们提出了 OmniWeaving,这是一种全方位视频生成模型,具有强大的多模态合成和推理能力。通过利用包含各种组合和推理增强场景的大规模预训练数据集,OmniWeaving 学会暂时绑定交错文本、多图像和视频输入,同时充当智能代理来推断复杂的用户意图以进行复杂的视频创建。此外,我们还推出了IntelligentVBench,这是第一个旨在严格评估下一代智能统一视频生成的综合基准测试。大量实验表明,OmniWeaving 在开源学术统一模型中实现了 SoTA 性能。代码和模型是公开的。项目页面:https://omniweaving.github.io。