论文
通过混合专家潜在对齐生成物理信息视频
Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment
摘要
大规模视频生成模型在语义一致性和视觉质量方面取得了显着进步,生成的视频越来越连贯且视觉上令人信服。然而,像素级拟合引起的动力学并不能自然地适应控制现实世界运动和交互的规律,导致物理合理性方面持续存在缺陷。为了解决这个限制,我们提出了 \textbf{PILA} (Physics-Informed Latent Alignment),这是一个将物理结构的潜在指导注入到预训练视频模型的冻结流匹配动力学中的框架。具体来说,PILA 首先采用锚定场估计将冻结的生成器潜伏映射到由场代理槽组织的操作物理属性库中,使用可观察的运动作为运动学锚来构建较少直接观察到的代理。为了处理现实世界动态的异质性,PILA 在物理类别上采用了专家混合设计。标签优先屏蔽专家路由选择特定类别的算子专家,其细化通过从物理关系中抽象的操作残差进行正则化。最后,精炼后的代理被融合到物理属性库中,并解码为对流匹配向量场的校正,注入物理感知指导,同时保留预训练主干的视觉先验。通过在 Wan 2.1-1.3B 上进行分阶段适配器训练并将学习到的适配器直接转移到 Wan 2.2-14B,PILA 在 VBench-2.0、VideoPhy-2 和 PhyGenBench 上的视觉质量和基准测量的物理合理性方面均取得了最先进的结果。