论文
MemoGen:过去的经验能否改善未来的文本到图像生成?
MemoGen: Can Past Experience Improve Future Text-to-Image Generation?
摘要
现代文本到图像模型已经实现了强大的视觉合成,但当提示需要隐式视觉约束、关系推理或外部知识时,仍然不可靠。现有的检索增强和代理生成方法通过获取外部知识、参考文献或当前请求的精细提示来缓解这个问题,但它们通常将每一代视为一个孤立的事件,并且不会系统地保留过去的成功或失败以供将来使用。在这项工作中,我们询问文本到图像系统是否可以在不更新底层生成器的情况下不断改进其自身的生成体验。我们提出了 MemoGen,一个 无需训练 框架,它通过代理进化层增强了现有的图像生成器。对于每项任务,MemoGen 明确推断视觉需求,在必要时检索外部证据和参考,将其转化为可执行的生成约束,评估生成的结果,并将任务理解、参考选择、视觉反馈、成功策略和失败教训存储为可重用的经验记忆。在进化轮次中,代理检索相关经验来改进类似的后代,有选择地修复以前失败的案例,同时保留成功的案例,从而实现测试时的自我进化,而无需更新参数。对知识密集型和推理导向基准的大量实验证明了这种范式的有效性:仅经过两轮演进,基于开源 Qwen-Image 主干网络构建的 MemoGen 就超越了 WISE 和 Mind-Bench 上的 Nano Banana Pro 和 GPT-Image-1 等强大的专有系统,表明显式经验记忆可以作为可靠的文本到图像生成的强大持续学习信号。