论文

RS-Gen:用于推理和搜索增强图像生成的多阶段代理框架

RS-Gen: A Multi-Stage Agentic Framework for Reasoning and Search-Augmented Image Generation

智能体系统Agent 架构与控制循环

摘要

近年来,图像生成和编辑方面取得了显着进步,特别是在指令遵循和视觉保真度方面。然而,在处理模糊意图、逻辑推理和分布外(OOD)知识时,由于缺乏深度推理能力和实时外部信息,现有图像模型往往会产生次优结果。尽管新兴的统一理解和生成模型试图弥合这一差距,但它们仍然受到其内在参数尺度和静态知识差距的限制。受代理范式的启发,我们提出了 RS-Gen:即插即用、无需训练、多阶段图像代理框架。 RS-Gen创新性地引入“提问与解决”闭环机制,准确识别逻辑问题和知识差距,自主规划行动以弥补信息缺陷并执行深度逻辑推理。大量实验表明,RS-Gen 显着扩展了基础图像生成和编辑模型的能力边界。具体来说,在 WISE Verified 和 RISEBench 基准测试中,RS-Gen 为 Qwen-Image 带来了 0.313 的绝对性能提升,为 Qwen-Image-Edit-2511 带来了 19.70 的大幅绝对性能提升,成功地将两者提升到开源模型中最先进 (SOTA) 的水平。