论文

提示中继:多事件视频生成的推理时间时间控制

Prompt Relay: Inference-Time Temporal Control for Multi-Event Video Generation

模型推理解码与生成控制

摘要

视频扩散模型在生成高质量视频方面取得了显着的进步。然而,这些模型很难表示现实世界视频中多个事件的时间连续性,并且缺乏明确的机制来控制语义概念何时出现、它们持续多长时间以及多个事件发生的顺序。这种控制对于电影级视频合成尤其重要,其中连贯的故事讲述取决于精确的时间、持续时间和事件之间的过渡。当使用单个段落式提示来描述一系列复杂事件时,模型通常会表现出语义纠缠,其中针对视频中不同时刻的概念相互渗透,导致文本与视频的对齐不良。为了解决这些限制,我们提出了 Prompt Relay,这是一种推理时间、即插即用的方法,可以在多事件视频生成中实现细粒度的时间控制,不需要架构修改,也不需要额外的计算开销。 Prompt Relay在交叉注意力机制中引入了惩罚,使得每个时间段仅关注其分配的提示,允许模型一次表示一个语义概念,从而改善时间提示对齐,减少语义干扰,并增强视觉质量。