论文

AnimateAnyMesh++:用于高保真文本驱动网格动画的灵活前馈框架

AnimateAnyMesh++: A Flexible Feed-Forward Framework for High-Fidelity Text-Driven Mesh Animation

应用与实践内容创作

摘要

4D 内容生成的最新进展引起了越来越多的关注,但由于时空分布建模的复杂性和 4D 训练数据的稀缺性,创建高质量的动画 3D 模型仍然具有挑战性。我们推出了 AnimateAnyMesh++,这是一个用于任意 3D 网格文本驱动动画的前馈框架,在数据、架构和生成能力方面都有重大升级。首先,我们通过挖掘 Objaverse-XL 中的动态内容来扩展 DyMesh-XL 数据集,将唯一身份的数量从 60K 增加到 300K,并大幅拓宽类别和运动多样性。其次,我们重新设计了 DyMeshVAE-Flex,具有幂律拓扑感知注意力和顶点法线增强功能,这显着改善了轨迹重建、局部几何保留,并减轻了轨迹粘滞伪影。第三,我们对 DyMeshVAE-Flex 和整流流 (RF) 生成器进行了架构更改,以支持可变长度序列训练和生成,从而在保持重建保真度的同时实现更长的动画。大量实验表明,AnimateAnyMesh++ 可在几秒钟内生成语义准确且时间连贯的网格动画,在质量和效率方面超越了先前的方法。扩大的 DyMesh-XL、升级的 DyMeshVAE-Flex 和可变长度 RF 一起在基准测试和野外网格中提供一致的增益。我们将在接受本手稿后发布代码、模型和扩展的 DyMesh-XL,以促进 4D 内容创建的研究。