论文
NoisEasier:文本到视频生成的测试时噪声优化
NoisEasier: Test-Time Noise Optimization for Text-to-Video Generation
摘要
扩散模型最近在文本到视频(T2V)生成方面取得了进展,但它们仍然难以处理细粒度的组合对齐,例如属性绑定、空间关系和对象交互。虽然基于奖励的 微调 改善了一致性,但它很容易受到 奖励作弊 的影响,并且很难适应新的提示分布。在这项工作中,我们提出了 NoisEasier,这是一个测试时间缩放框架,它通过可微奖励引导的噪声优化来改进 T2V 的生成,而无需修改底层模型。通过将高效的短步生成器与多目标奖励公式相结合,NoisEasier 可在实际的推理预算下实现稳定且实用的测试时间优化。我们的主要见解是,与仅优化初始潜在变量相比,联合优化整个随机轨迹可以加速奖励收敛并改善组合对齐,而额外的计算和时间成本可以忽略不计。 VBench 和 T2V-CompBench 上的实验证明了跨多个主干网的一致改进,在属性绑定、对象交互和计算能力等具有挑战性的维度上实现了超过 10% 的平均增益。总体而言,NoisEasier 既是基于奖励的 微调 的灵活替代方案和补充增强功能,将测试时间扩展建立为可控文本到视频生成的有效范例。