论文
CoaG:网格上的圆柱体,用于视频生成中的粗略 3D 布局控制
CoaG: Cylinders on a Grid for Coarse 3D Layout Control in Video Generation
摘要
我们询问一个人需要绘制多少几何图形来控制人们站立的位置以及相机在生成的视频中移动的位置。我们的答案是每人一个地平面和一个气瓶。用户在地面上画一个网格,在每个人应该站立的地方放置一个圆柱体,在 81 帧内移动圆柱体和摄像机,模型渲染出一个逼真的视频,其中人们占据圆柱体的位置,随着圆柱体的移动而移动,并从绘制的摄像机中看到。外观来自文字提示和背景参考图片;布局和运动来自几何形状。因为没有数据集将这样的信号与视频配对,所以我们自己构建配对:自动引擎从组合种子写入 2000 个字幕,使用文本到视频模型为每个字幕生成一个剪辑,并通过人物跟踪、背景修复、代理地面遮罩循环、前馈多视图重建和平面拟合将每个剪辑提升回其几何形状,没有真实的镜头和手动标签。 1935 年在 Wan2.2-Fun-Control 上训练的 LoRA 元组遵循绘制的布局和保留剪辑上的摄像机路径:生成的人物与圆柱体的计数、顺序、位置和高度相匹配,文本改变他们的身份,参考图像改变他们所在的位置,并遵循推入、轨道、平移和起重机路径,仅微弱地推出。