论文

EmoWorld:用于可控情感视频生成的解耦情感场

EmoWorld: A Decoupled Affective Field for Controllable Emotional Video Generation

应用与实践内容创作

摘要

情感决定了观众如何解读场景,但现有的视频生成器将全局氛围、情感语义线索和时间进程纠缠在单个文本条件中。我们提出了 EmoWorld,一个框架,可以在冻结的流匹配视频扩散 Transformer(视频 DiT)中解耦这些因素。一次性准备阶段从保留几何形状的中性和情感编辑的全景图中提取特定于图层的情感方向和可重复使用的线索库。在推理时,视觉气氛引导 (VAS) 将气氛方向注入隐藏状态,语义情感引导 (SAS) 隔离语义线索的单独可扩展的提示残差,时间情感引导 (TAS) 在去噪和视频时间之间插入端点残差字段。在 Wan2.2 上,VAS 将目标情绪一致性提高了 19%,同时将时间波动代理减少了 48%; SAS 将目标情感一致性提高了 37%,并将检测到的情感线索增加了 36%;与最强基线相比,TAS 将转换单调性提高了 15%。 EmoWorld 在文本到视频和图像到视频设置中对 27 个情感类别进行了评估,展示了跨多个 Video-DiT 主干的可移植性,并支持相机条件合成,而无需更新生成器参数。