论文
SCMAPR:面向复杂场景文本到视频生成的自纠正多智能体提示词精炼
SCMAPR: Self-Correcting Multi-Agent Prompt Refinement for Complex-Scenario Text-to-Video Generation
摘要
文本到视频(T2V)的生成受益于扩散模型的最新进展,但当前的系统仍然在复杂的场景下挣扎,而文本提示的模糊性和不规范通常会加剧这种情况。在这项工作中,我们将复杂场景提示细化制定为分阶段的多智能体提示细化过程,并提出了 SCMAPR,即用于 T2V 提示的场景感知和自校正多智能体提示细化框架。 SCMAPR 协调专门的代理来 (i) 将每个提示路由到基于分类的场景以进行策略选择,(ii) 综合场景感知重写策略并执行策略条件细化,以及 (iii) 进行结构化语义验证,在检测到违规时触发条件修订。为了阐明 T2V 提示中复杂场景的构成,提供代表性示例,并在这种具有挑战性的条件下进行严格评估,我们进一步引入了 {T2V-Complexity},这是一个仅由复杂场景提示组成的复杂场景 T2V 基准。对 3 个现有基准测试和我们的 T2V-Complexity 基准测试进行的大量实验表明,SMAPR 在复杂场景下持续改进了文本视频对齐和整体生成质量,在 VBench 和 EvalCrafter 上的平均得分分别提高了 2.67% 和 3.28,与 3 个 State-Of-The-Art 基准相比,T2V-CompBench 的平均得分提高了 0.028。
