论文
WanPE:迈向现代文本到视频生成的电影提示增强
WanPE: Towards Cinematic Prompt Enhancement for Modern Text-to-Video Generation
摘要
视频生成从文本空间开始,创作电影剧本,然后具体化为像素。由于当代视频生成器的时长已扩展到 30 秒并忠实地遵循复杂的条件,因此文本提示在很大程度上指导着制作,规划动作、摄像机轨迹、灯光和声音如何在多镜头序列中展开。在本文中,我们提出了 WanPE,这是一个 397B 参数的提示增强模型,在 105 万个真实视频上进行训练,以掌握导演级的电影规划。 WanPE 通过基于视频的逆向构建来制定镜头级电影计划,并采用语义一致性 GRPO (SC-GRPO) 来忠实地保留跨镜头和一段时间内的用户需求。为了对这种能力进行基准测试,我们策划了 WanPEval,这是一个人工注释的测试平台,涵盖不同意图粒度的 5 到 30 秒的持续时间,并由大约 11K 盲配对评估支持。当为 Wan3.0 的视频生成器供电时,WanPE-397B 将人类对原始用户提示的偏好在 5-15 秒内提高了 10.66-18.84 点,在 30 秒范围内提高了 50.86 点。消融研究表明,反向构造表现出明显优于正向重写的优势,而 SC-GRPO 在模型尺度上稳健地保持了语义保真度。最终,WanPE 在 5-15 秒内领先于所有评估的商业产品,并在 30 秒内与 Seedance 2.5 保持竞争力。