论文

TempAct:通过 Planner-Executor RL 提高自回归视频生成的时间合理性

TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL

模型训练强化学习

摘要

自回归 (AR) 视频扩散模型通过使用缓存的视觉上下文逐块合成视频来实现低延迟流生成,但这种按块的公式使得时间指令遵循模糊性。单个全局提示不指定应在每个块中实现哪个子事件,而天真地切换到逐步提示通常会导致延迟反应、混合步骤语义以及跨提示转换的错误传播。这些故障很难仅用有监督的 微调 或 蒸馏 来解决:SFT 存在暴露偏差,而基于 rollout 的 蒸馏 仍然优化底层去噪或教师分布匹配,而不是直接强制执行动作排序和提示转换正确性。我们使用 TempAct 来应对这些挑战,这是一个规划器-执行器强化学习框架,可联合优化时间分解和步骤条件执行,以生成时间上合理的 AR 视频。 TempAct 使用 LLM 规划器来探索可由视频模型执行的跨度感知步骤提示,并训练 AR 扩散执行器在其自己生成的历史记录下遵循这些提示。其关键机制是分层组探索:候选计划形成计划组,每个计划从共享的视觉上下文中诱导出多个延续的执行组,从而实现长范围时间结果的计划级贡献分配和提示切换行为的执行器级贡献分配。我们进一步设计了分层奖励,将规划器的计划质量和全视频时间反馈与执行器的局部转换级步骤跟踪奖励、美学正则化和 KL 约束结合起来。 Self-Forcing 和 LongLive 的实验表明,TempAct 提高了时间一致性,同时保持了整体视觉质量。