论文

AVControl:用于训练视听控制的有效框架

AVControl: Efficient Framework for Training Audio-Visual Controls

模型训练参数高效训练

摘要

控制视频和音频生成需要多种模式,从深度和姿势到相机轨迹和音频转换,但现有方法要么为一组固定的控制训练单个整体模型,要么为每种新模式引入昂贵的架构更改。我们引入了 AVControl,这是一个基于 LTX-2 的轻量级可扩展框架,LTX-2 是一个联合视听基础模型,其中每个控制模态都在并行画布上作为单独的 LoRA 进行训练,提供参考信号作为注意力层中的附加标记,除了 LoRA 适配器本身之外,不需要进行任何架构更改。我们证明,简单地将基于图像的上下文方法扩展到视频无法实现结构控制,而我们的并行画布方法解决了这个问题。在 VACE 基准测试中,我们在深度和姿势引导生成、修复和修复方面优于所有评估的基准,并在相机控制和视听基准方面显示出有竞争力的结果。我们的框架支持多种独立训练的模式:空间对齐的控制,例如深度、姿态和边缘、具有内在函数的相机轨迹、稀疏运动控制、视频编辑,以及据我们所知,用于联合生成模型的第一个模块化视听控制。我们的方法具有计算效率和数据效率:每种模态仅需要一个小数据集,并在几百到几千个训练步骤内收敛,这只是整体替代方案预算的一小部分。我们公开发布我们的代码和经过训练的 LoRA 检查点。