论文
R-DMesh:通过修正动态网格流进行视频引导的 3D 动画
R-DMesh: Video-Guided 3D Animation via Rectified Dynamic Mesh Flow
摘要
视频引导的 3D 动画在内容创建方面具有巨大的潜力,可以提供对动态资产的直观和精确的控制。然而,实际部署面临着一个关键但经常被忽视的障碍:姿态错位困境。在现实场景中,用户提供的静态网格物体的初始姿态很少与参考视频的起始帧对齐。天真地强制网格遵循不匹配的轨迹不可避免地会导致严重的几何扭曲或动画失败。为了解决这个问题,我们提出了校正动态网格 (R-DMesh),这是一个统一的框架,旨在生成经过“校正”以与视频上下文保持一致的高保真 4D 网格。与标准运动传递方法不同,我们的方法引入了一种新颖的 VAE,它将输入明确地分解为条件基础网格、相对运动轨迹和关键的校正跳跃偏移。学习该偏移量可以自动变换输入网格的任意姿势,以匹配动画开始之前视频的初始状态。我们通过 Triflow Attention 机制处理这些组件,该机制利用顶点几何特征来调制三个正交流,确保校正和动画过程中的物理一致性和局部刚性。对于生成,我们采用基于预训练视频潜值的基于整流流的扩散 Transformer,有效地将丰富的时空先验转移到 3D 域。为了支持这项任务,我们构建了 Video-RDMesh,这是一个包含超过 500k 动态网格序列的大型数据集,专门用于模拟姿势错位。大量实验表明,R-DMesh 不仅解决了对齐问题,而且还支持强大的下游应用,包括姿势重定向和整体 4D 生成。