论文

KGEdit:用于 无需训练 精确视频生成和编辑的歧义感知知识图

KGEdit: Ambiguity-Aware Knowledge Graphs for Training-Free Precise Video Generation and Editing

模型推理解码与生成控制

摘要

近年来,无需训练 视频生成取得了显着进步。然而,在处理复杂的文本指令时,现有方法仍然存在语义模糊、概念绑定不正确和跨框架不一致等问题。为了解决这些问题,我们提出了 KGEdit,一种用于文本到视频(T2V)扩散模型的结构化语义控制框架。具体来说,我们首先构建一个歧义感知知识图(AAKG)来理清输入提示并消除歧义,将其转换为四种类型的结构化语义:身份、关系、属性和否定约束。然后,我们设计了一个结构化语义注入模块(SSIM),将这些语义信号注入到扩散Transformer的关键层中,从而实现细粒度的语义控制。此外,我们引入了时间感知语义控制(TASC)模块,该模块根据去噪过程的阶段性特征动态调度语义目标,进一步提高语义对齐和时间一致性。实验表明,KGEdit 在编辑精度和时间稳定性方面优于现有方法,同时在文本驱动的交互场景中提供更高的效率和可控性。