论文

Prompt2Effect:通过 LoRA 生成实现 无需训练 图像到视频模型专业化

Prompt2Effect: Training-Free Image-to-Video Model Specialization via LoRA Generation

模型训练参数高效训练

摘要

虽然高端一代越来越需要具有特定视觉效果的个性化图像到视频 (I2V) 扩散模型,但当前的实践需要为每种效果训练单独的低秩适应 (LoRA) 模块,从而产生大量数据管理和迭代优化成本,从而阻碍交互控制。我们提出了 Prompt2Effect,一种权重驱动的超网络,它通过在单次前向传递中直接合成特定于效果的 LoRA 权重来分摊每个效果的训练。与之前纯粹从语义回归适配器权重的超网络不同,Prompt2Effect 明确以冻结的基础模型权重为条件,将预测基于每层的结构几何。此外,我们不是预测原始 LoRA 矩阵,而是引入了 SVD 规范化参数化,可以解决分解模糊性并稳定大规模合成。大量实验表明,与传统 LoRA 微调 相比,Prompt2Effect 实现了同等或更高的视频质量和效果对齐,同时将计算成本从 56 个 GPU 训练小时减少到 3.3 秒的超网络推理。当用作后续 微调 的初始化时,我们的预测权重进一步提高了最终性能并将优化速度提高了约 10 倍。