论文

超越反复试验:图像到视频依从性的代理优化

Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence

智能体系统Agent 架构与控制循环

摘要

现代黑盒图像到视频 (I2V) 模型在自动化内容创建方面提供了强大的功能,但它们缺乏细粒度的控制和可靠性,给专业工作流程带来了重大挑战。它们固有的随机性会导致文本提示或超参数发生微小变化,从而产生截然不同的输出,通常需要低效、强力的试错过程。为了解决这些限制,我们引入了“代理自我改进”框架,它将视频合成重新构建为闭环、目标导向的优化。我们的框架使用新颖的两阶段方法系统地导航生成参数空间。在第一阶段,迭代提示优化循环使用多模态 大语言模型 (mLLM) 来细化输入提示。这种细化实现了两个自动评估:戴维森场景图 (DSG) 查询确保语义在第二阶段,我们使用贝叶斯优化来有效地共同优化随机种子和 CFG 尺度,包括从 DSG 和 CMQ 评估中得出的新颖的视频文本遵循度 (VTA) 分数,我们的框架显着优于无引导的搜索方法:在人类偏好研究中,通过我们的代理方法生成的视频比基线输出更受欢迎。 69\%。这项工作提供了一种实用且可扩展的方法,用于增强最先进的视频生成模型的可预测性和控制,使该领域超越投机好奇心,转向可靠的、可用于生产的工具。