论文

VideoCoCo:通过代理双引擎系统生成物理一致的视频的 Code-as-CoT

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

模型推理推理策略与问题分解

摘要

文本到视频模型已经实现了卓越的视觉质量,但它们仍然难以生成物理上一致的动态,因为场景的时间演变必须从高度压缩的文本提示中隐式推断出来。现有的思想链方法引入了中间计划或视觉状态,但这些表示通常是不可执行的或时间稀疏的,限制了它们实例化和控制完整时空过程的能力。为了解决这个限制,我们引入了 VideoCoCo,一个代理双引擎框架,其中可执行的 Blender 代码充当流程级思想链。给定文本提示,编码智能体 会合成一个 Blender 程序,该程序明确指定场景及其时间演变。可执行模拟引擎运行该程序以生成确定性时空草稿,随后由生成视频引擎通过草稿条件编辑将其转换为逼真的视频。这种分解将过程级推理与高保真视觉实现分开。为了使视频编辑器适应模拟草稿,我们构建了 VideoCoCo-3K,这是草稿-指令-目标三元组的精选数据集。 VideoCoCo 将 OmniWeaving 基准在 PhyGenBench 上从 0.475 提高到 0.558,在 VBench-2.0 上从 52.18 提高到 77.88,在两个基准上均取得了最佳平均分数。这些结果表明,可执行代码为物理一致的视频生成提供了有效、可控且可检查的中间表示。