论文
Disco-LoRA:内容、风格和动作的解开组合,用于多概念视频定制
Disco-LoRA: Disentangled Composition of Content, Style, and Motion for Multi-concept Video Customization
摘要
基于文本到视频(T2V)模型的视频定制旨在从参考数据中学习特定特征以生成可控视频。尽管在图像风格化和视频动作定制方面取得了重大进展,但同时控制多个概念(例如内容、风格和动作)仍然是一个重大挑战。在这项工作中,我们系统地定义了多概念视频定制的任务,这需要内容、风格和动作的联合控制。为了促进这一领域的研究,我们构建了一个全面的基准,并提出了 Disco-LoRA,一个统一的框架,旨在通过分两个阶段解开和灵活重组不同的概念来解决这个问题:(1)我们将目标分解为两个子任务:内容风格和内容运动。每个子任务都使用我们的迭代双 LoRA 解缠框架来解决,该框架可以有效地解开数据中的不同概念。 (2) 我们认为分层权重趋势对于 LoRA 身份至关重要,而权重大小决定了可组合性。为了协调这些尺度,我们提出了一种基于 Z 分数的统计正则化,可以对齐权重分布,保留分层趋势,同时最大限度地减少不同 LoRA 之间的干扰。大量实验表明,Disco-LoRA 擅长多概念视频定制,有效保留外观、风格和运动,以实现可控的文本到视频生成。