论文

PhysLDM:高保真形变模拟的潜在扩散

PhysLDM: Latent Diffusion for High-Fidelity Deformable Simulation

模型架构混合架构

摘要

高保真变形体的神经模拟是计算机图形学和物理人工智能领域的基本挑战。高分辨率 3D 体积网格的长视野预测很困难:自回归方法容易受到误差累积的影响,而原始分辨率下的直接多帧预测在计算上是令人望而却步的。这激发了紧凑的时空潜在表示,这对于基于网格的体积物理来说在很大程度上尚未被探索。与此同时,尚不清楚确定性回归还是生成扩散是否是更合适的预测范式。为了解决这些耦合挑战,我们引入了 PhysLDM,这是一种用于一次性体积变形模拟的统一潜在扩散范例。其核心是整体时空 VAE,避免了标准时间压缩的“阶梯”伪影(如常见视频 VAE),以高达 78 倍 token 压缩在米级场景上实现约 2.48 毫米重建 精度。基于这个可靠的潜空间,我们系统地比较了回归和扩散方法。我们的实验揭示了一个关键的建模见解:复杂的可变形动力学通常是混乱的,在这种情况下,确定性回归往往会产生非物理平均值,而扩散可以更好地模拟它们的分布。因此,我们采用潜在扩散模型,可以有效地从混沌数据中学习,以生成物理上合理的轨迹。单个 PhysLDM 在 Objaverse 规模数据集上进行纯粹运动学训练,可将零样本推广到未见过的 OOD 数据集(GSO 和 Toys4K)。其可微性进一步实现了反问题的高效解决和高阶设计优化。据我们所知,PhysLDM 是第一个用于体积可变形动力学的高保真时空自动编码器和潜在扩散范式,为神经模拟提供了可扩展且稳健的方法。

PhysLDM:高保真形变模拟的潜在扩散:论文原图
图 1:PhysLDM 概述。顶部,重建:未见过的高分辨率软杯子(11,621 个节点,${>}2\times$ 和训练上限)的地面实况(玫瑰)与 ST-VAE 重建(蓝色)。轨迹经过 ${\sim}182\times$ 压缩,平均误差仅为 5.3 mm。最右边:最终框架的横截面,可视化内部四面体结构。左下,预测:对不同材料和初始速度的各种分布外 (OOD) 对象 (GSO/Toys4K) 的 64 帧轨迹进行一次性预测(插图:初始状态;主视图:预测的稳定状态)。右下,可微分应用:经典的材料估计任务:通过梯度下降匹配目标状态(纹理)来恢复杨氏模量 $E$(蓝色序列)。此外,设计最能揭示材料的投掷是一个二阶逆任务(第 4.2 节)。 PhysLDM 通过对高阶导数的本机支持轻松解决该问题。相比之下,我们测试的所有其他可微模拟器要么失败,要么在计算上无法完成此任务。