论文

CAPE-T2V:文本到视频生成中双向调节对齐的视频描述锚定提示增强

CAPE-T2V: Captioner-Anchored Prompt Enhancement toward Two-Sided Conditioning Alignment in Text-to-Video Generation

模型训练监督微调与指令调优

摘要

文本到视频 (T2V) 扩散 Transformer (DiT) 使用详细的视频视频描述进行训练,而推理通常依赖于提示增强器 (PE) 重写的用户提示。先前的工作通过优化 PE、DiT 或两者来改进生成;一些方法还试图通过共享模式来缩小训练与推理的不匹配。然而,即使在共享模式中,推理时 PE 输出和 DiT 训练描述在细节选择、信息组织、描述粒度和措辞方面仍然可能有所不同。我们将这种残余不匹配称为 PE-Caption 间隙,并引入 CAPE-T2V,这是一种两步式 Captioner 锚定提示增强框架,旨在实现 T2V 生成中的两侧调节对齐。首先,CAPE-T2V 构建了三种类型的 PE 训练示例,将视频描述生成器生成的目标与简洁的源视频描述、详细的源视频描述或从这些目标派生的伪用户提示配对。然后它微调 PE 以将每个输入映射到其配对目标。其次,CAPE-T2V 对 Anchored PE 重写的视频衍生视频描述上的 DiT 进行微调;同一个 PE 会在推理时重写用户提示。相对于使用相同视频描述模式的基线,CAPE-T2V 在 Wan2.2 和 LTX-2.3 的 StoryEval、VBench-2.0 和 T2V-CompBench 上获得了更高的总分。此外,CAPE-T2V 表现出比基线更小的 PE-Caption 差距:其 DiT 微调 视频描述的分布更接近推理时间 PE 输出,这是通过固定嵌入空间中的平方最大平均差异来衡量的。总体而言,这些结果支持 CAPE-T2V 作为缩小 PE-Caption 差距的有效方法。该项目位于 https://github.com/yizzz927/CAPE-T2V。