论文
通过推理时间无梯度优化生成空间条件约束的文本到视频
Spatially-Grounded Text-to-Video Generation via Inference-Time Gradient-Free Optimization
摘要
Diffusion Transformer 文本到视频模型已经实现了卓越的合成质量,但细粒度的空间可控性仍然是一个重大挑战。虽然现有的 无需训练 方法在空间条件约束的生成(即将特定对象放置在指定位置)中产生了可靠的总体结果,但它们依赖于基于梯度的优化技术,这些技术会产生过高的计算开销,这是现代大规模体系结构中放大的瓶颈。为了解决这一限制,我们提出了无梯度分析轨迹优化视频生成(GATO-Vid),这是一种新颖的 无需训练 和无梯度方法,用于精确的空间引导。我们不依赖于代价高昂的向后传递,而是引入了另一种交叉注意力分数并对其进行分析求解以获得精确的封闭式解决方案。为了使用我们的解析解,我们提出了一种针对 Transformer 潜在空间的拓扑流形量身定制的动态注入机制。我们的实验表明,GATO-Vid 在定位精度方面显着优于现有基线,同时引入最小的计算开销。