论文

EasyVFX:频率驱动解耦,实现资源高效的 VFX 生成

EasyVFX: Frequency-Driven Decoupling for Resource-Efficient VFX Generation

摘要

由于空间纹理和时间动态的复杂耦合,生成高保真视觉效果 (VFX) 通常需要大量数据集和令人望而却步的计算能力。在本文中,我们介绍了 EasyVFX,这是一个资源高效的框架,可以在严格的约束下实现逼真的 VFX 合成。我们的核心理念在于频域分解:我们观察到,通过将代表复杂空间外观的高频分量与封装全局运动动力学的低频分量解耦,可以显着降低视觉特效的复杂性。这种谱解缠结将高维学习问题转化为可管理的子任务,从而降低优化障碍并减少数据依赖性。基于这一见解,我们提出了一个两阶段的训练范例。首先,我们设计了一个频率感知混合专家(Freq-MoE)架构。通过利用软路由机制,我们的模型将专业专家分配到不同的光谱带,使他们能够培养外观和运动动力学的强大先验。这种专业化允许模型以更少的 GPU 资源获取基础 VFX 知识。其次,我们引入了一种由新颖的频率约束损失驱动的测试时训练策略。这使得预先训练的模型能够通过局部优化快速适应特定的、看不见的效果,在单个 GPU 上只需要大约 100 个步骤。实验结果表明,EasyVFX 可产生结构一致且视觉上令人惊叹的效果,证明频率感知学习是专业级 VFX 民主化的关键催化剂。