论文

CogOmniControl:通过创意意图认知生成推理驱动的可控视频

CogOmniControl: Reasoning-Driven Controllable Video Generation via Creative Intent Cognition

应用与实践内容创作

摘要

最近的扩散模型在视频生成中实现了很强的照片真实性和流畅性,但在抽象、稀疏或复杂的条件下仍然脆弱,导致在专业制作工作流程(例如故事板草图和粘土渲染条件)中表现不佳。现有的视频生成模型要么通过适配器注入条件,要么在扩散主干中耦合通用视觉语言模型 (VLM),从而留下了能力差距,无法生成符合用户创意意图的视频。我们提出了 CogOmniControl,一个推理驱动的框架,它将可控视频生成分解为创意意图认知和生成。具体来说,我们使用真实的动漫制作数据训练专门的 CogVLM。与通用VLM相比,它产生更专业、更清晰的输出,从稀疏和抽象的条件中准确识别用户的创作意图,并将这些线索调整为密集的推理输出。此外,CogOmniDiT 通过上下文生成统一了各种条件的控制,并通过强化学习与 CogVLM 推理输出保持一致。此外,利用 CogVLM 在指导视频生成方面的强大功能,我们释放了其在规划特定评估者方面的潜力,并为生成的视频实现了 Best-of-N 选择。这种集成将整个框架转变为闭环“Harness式”架构。我们进一步介绍了 CogReasonBench 和 CogControlBench,它们是根据专业工作流程数据构建的,这些数据携带真正的创意意图而不是模拟意图。两个基准测试的实验表明,CogOmniControl 超越了现有的开源模型。项目网站:https://um-lab.github.io/CogOmniControl/