论文

作为原生 4D 渲染器的视频模型:来自动画网格的基于世界的调节

Video Models as Native 4D Renderers: World-Grounded Conditioning from Animated Mesh

应用与实践内容创作

摘要

当动画网格、摄像机轨迹和参考图像已指定所需的场景状态时,预训练的视频扩散模型可以充当渲染器。这种 4D 生成渲染设置提出了一个表示问题:什么图像格式条件可以让视频主干同时服从相机运动和场景内部动画?我们提出了 DAR,这是一种参考引导渲染器,它将 Wan2.2 摄像机控制从单独的 Plücker 射线扩展到联合摄像机加几何接口。 DAR 从动画网格中投射神经 4D G 缓冲区(跟踪、世界位置和法线),并通过加宽的控制适配器将其注入,同时保留预先训练的图像到视频的先验。核心设计选择是跟踪和世界位置对。跟踪识别应携带外观的持久表面元素;世界位置给出了当前的场景坐标状态;正常提供局部形状。深度加上校准光线原则上可以恢复 3D,但深度是依赖于相机的图表,其中相机和物体运动混合在一起。在 68 例 DAR-4D 基准测试中,LoRA DAR 达到 PSNR 23.22、SSIM 0.895 和 LPIPS 0.134,比现成的 Wan2.2-Depth 提高了 1.54 dB PSNR;完全微调达到 PSNR 25.36 和 SSIM 0.917。匹配的消融表明,用深度替换世界位置会在每个检查点降低 PSNR 1.26--1.55 dB,支持跟踪+世界位置对应作为实用的 4D 渲染条件。