论文
面向空间定位文生图生成的智能体流引导与并行展开搜索
Agentic Flow Steering and Parallel Rollout Search for Spatially Grounded Text-to-Image Generation
摘要
精确的文生图(T2I)生成已取得巨大成功,但受限于静态文本编码器有限的关系推理能力与开环采样中的误差累积。缺乏实时反馈时,常微分方程(ODE)轨迹初期的语义歧义不可避免地升级为对空间约束的随机偏离。为弥合该差距,我们提出 AFS-Search(Agentic Flow Steering and Parallel Rollout Search),一个基于 FLUX.1-dev 构建的免训练闭环框架。AFS-Search 整合了免训练的闭环并行展开搜索与流引导机制,利用视觉语言模型(VLM)作为语义评判器诊断中间潜变量,并通过精确的空间定位动态引导速度场。作为补充,我们将 T2I 生成形式化为序贯决策过程,通过前瞻模拟探索多条轨迹,并基于 VLM 引导的奖励选择最优路径。此外,我们提供面向更高性能的 AFS-Search-Pro 与面向更快生成的 AFS-Search-Fast。实验结果表明,AFS-Search-Pro 大幅提升了原始 FLUX.1-dev 的性能,在三个不同基准上取得最先进结果。同时,AFS-Search-Fast 在保持快速生成速度的同时也显著增强了性能。
