论文
通过代理增强和语义修复生成保留身份的文本到视频
Identity-Preserving Text-to-Video Generation via Agentic Enhancement and Semantic Repair
摘要
保留身份的视频生成旨在合成遵循自然语言指令的视频,同时保持给定主题的视觉身份。最近的商业视频生成模型已经实现了强大的视觉质量和运动真实感,但它们仍然存在身份漂移、不完整的指令遵循以及复杂提示下视觉细节缺失的问题。由于这些模型通常是闭源黑匣子,因此直接通过参数优化来改进它们通常是不可行的。因此,我们提出代理增强和语义修复(AESR),这是一种用于身份保护视频生成的轻量级增强框架。为了改进生成前的提示构建并缓解上述故障,AESR 引入了全局代理提示增强模块。该模块从官方文档中学习特定于模型的提示格式,从人类交互数据中获取以人为中心的视频生成先验,并通过代理循环将测试域身份保留生成经验积累到可重用的剧本中。为了进一步修复增强提示生成的视频中的错误,AESR引入了样本级视觉语义修复模块,该模块使用VLM来定位错误的视频片段并设计修复指令,将选定的帧编辑为明确的视觉参考,并指导视频编辑模型修复局部语义或身份相关的错误。我们还采用轻量级的专家混合选择策略来从不同的生成和细化路径中选择可靠的输出。在ACM MM 2026身份保护视频生成挑战赛的官方评估协议下,我们的系统MIPL\_Video在Track 1中排名第一,证明了AESR在实际身份保护视频生成方面的有效性。该代码可从 https://github.com/oceanflowlab/AESR 获取。