论文

LooseControlVideo:使用空间阻塞的导演视频控制

LooseControlVideo: Directorial Video Control using Spatial Blocking

模型推理解码与生成控制

摘要

文本到视频生成中的精确 3D 空间编排仍然是一个重大挑战,特别是对于语义布局和时间动态经常纠缠在一起的多对象场景。虽然现有的深度条件模型实现了良好的结构保真度,但它们需要密集的、帧精确的指导,这对于编写涉及可变形物体的动态事件来说是劳动密集型的。我们提出了 LooseControlVideo,这是一个框架,通过使用稀疏的、定向的 3D 框作为“阻塞”代理来实现直观和富有表现力的控制。这允许用户创作高级布局和轨迹,同时利用视频生成模型生成逼真的遮挡、动态和交互。我们通过 微调 在视频数据集上使用 Wan 2.2 主干来实现这一目标,并使用 DNOCS 进行注释,DNOCS 是一种针对 3D 大小、方向和深度排序遮挡的新颖编码。此外,我们的方法允许局部细化,例如调整跳跃轨迹或添加交互,同时对全局场景上下文的干扰最小。对 nuScenes、HO-3D 和 BEHAVE 基准的广泛评估表明,LooseControlVideo 显着优于现有的 2D-box 和基于流的基准。我们的研究结果表明轨迹误差改善了 1.2 倍到 3 倍;刚性运动一致性提高 2 倍;与当前最先进的布局条件模型相比,遮挡精度提高了 1.5 倍到 2 倍,这表明定向 3D 图元为复杂的多智能体视频创作提供了良好的几何先验。