论文

SCMAPR:面向复杂场景文本到视频生成的自纠正多智能体提示词精炼

SCMAPR: Self-Correcting Multi-Agent Prompt Refinement for Complex-Scenario Text-to-Video Generation

智能体系统Agent 协作

摘要

文本到视频(T2V)的生成受益于扩散模型的最新进展,但当前的系统仍然在复杂的场景下挣扎,而文本提示的模糊性和不规范通常会加剧这种情况。在这项工作中,我们将复杂场景提示细化制定为分阶段的多智能体提示细化过程,并提出了 SCMAPR,即用于 T2V 提示的场景感知和自校正多智能体提示细化框架。 SCMAPR 协调专门的代理来 (i) 将每个提示路由到基于分类的场景以进行策略选择,(ii) 综合场景感知重写策略并执行策略条件细化,以及 (iii) 进行结构化语义验证,在检测到违规时触发条件修订。为了阐明 T2V 提示中复杂场景的构成,提供代表性示例,并在这种具有挑战性的条件下进行严格评估,我们进一步引入了 {T2V-Complexity},这是一个仅由复杂场景提示组成的复杂场景 T2V 基准。对 3 个现有基准测试和我们的 T2V-Complexity 基准测试进行的大量实验表明,SMAPR 在复杂场景下持续改进了文本视频对齐和整体生成质量,在 VBench 和 EvalCrafter 上的平均得分分别提高了 2.67% 和 3.28,与 3 个 State-Of-The-Art 基准相比,T2V-CompBench 的平均得分提高了 0.028。

SCMAPR:面向复杂场景文本到视频生成的自纠正多智能体提示词精炼
图 1:自校正多代理提示细化框架 (SCMAPR)。 SCMAPR 将快速细化组织为涉及六个专业代理的分阶段多代理协作。该框架经历五个功能阶段: (I) 场景路由,其中​​场景路由器将场景标签分配给输入提示。 (II)策略综合,其中策略生成器生成场景条件重写策略。 (III) 策略条件细化(Policy-Conditioned Refinement),其中提示细化器重写提示。 (IV)语义验证,Atomizer和Validator通过原子提取和蕴涵判断协同验证语义保真度。 (五)有条件修订,验证反馈有条件地触发针对性修订,实现自我修正细化。