论文

OctoT2I:自演化的智能体文生图路由器

OctoT2I: A Self-Evolving Agentic Text-to-Image Router

智能体系统上下文与知识记忆Agent 工具调用Agent记忆

摘要

文本到图像(T2I)模型的爆炸性增长,从大规模版本到轻量级实时模型,现在面临着单模型扩展带来的边际收益递减。 Agentic T2I 方法的出现是为了通过使用多个模型来缓解这一瓶颈。然而,现有的代理 T2I 方法面临三个关键挑战:依赖昂贵的手工先验或人工注释、严格的单路径决策机制以及忽视推理效率。为了应对这些挑战,我们引入了 OctoT2I,这是一种新颖的代理框架,它将 T2I 任务重新表述为生成质量和推理效率的联合优化。 OctoT2I 实现了有状态的多轮路由策略,可根据其知识和记忆自适应地选择最合适的工具。这一策略是通过我们新颖的自我进化机制从头开始构建的知识库来实现的。这种机制不需要人工监督,首先自主定义基本概念维度(例如样式、颜色、计数),然后通过迭代的“提议-解决-评估-学习”(PSEL)循环智能地探索它们的组合。 PSEL 循环有效地发现每个工具的能力前沿,无需外部指导即可推动持续改进。大量实验表明,OctoT2I 在 GenEval 上实现了具有竞争力的性能 (0.96),同时与领先基线 (Flow-GRPO) 相比,推理加速提高了 90.3%,能效增益提高了 56.6%,在性能和效率之间实现了卓越的平衡。将提供代码和模型。

OctoT2I:自演化的智能体文生图路由器:论文配图
图2:OctoT2I的整体架构。 (上)推理工作流程。代理接受用户提示并执行“原因-行动-反映”循环:决策策略利用其内存和知识模块来选择合适的工具。然后使用该工具生成图像,随后对其进行评估以获得质量分数。当分数达到质量阈值或达到轮数限制时,工作流程终止。 (下)自我进化机制。知识模块是从头开始自主、自适应构建的。它包括分层的高级工具配置文件和勘探记录。这种构建是由“提议-解决-评估-学习”(PSEL)循环驱动的,该循环以探索空间修剪策略为指导。