论文

WeAgent-MMGenEdit:多模式代理图像生成和编辑的全栈配方

WeAgent-MMGenEdit: A Full-Stack Recipe for Multimodal Agentic Image Generation and Editing

智能体系统Agent Harness

摘要

图像生成和编辑模型发展迅速,但在提示需要外部世界知识时仍然不可靠。有界和长尾参数知识阻止直接或推理然后生成的方法恢复所需的事实和视觉外观。现有的代理生成和编辑方法通过检索工具缓解了这一限制,但仍然受到视觉验证不足、策略模型过载以及检索到的文本和视觉证据集成薄弱的限制。为了解决这些限制,我们提出了 WeAgent-MMGenEdit,这是一个全栈配方,包括多模式工具、可扩展的数据构建管道、综合基准测试以及用于代理策略和图像后端的 后训练 方法。我们首先介绍 WeAgent-Harness,这是一个多模式运行时,具有持久证据管理和专用验证和集成工具,可将检索到的多模式证据组织到密集载体中。在此基础上,我们开发了一个可扩展的管道,用于快速合成和代理轨迹收集,产生 23K 个监督轨迹和 14.7K 个 RL 任务以及三层可验证检查表。我们进一步介绍了 WeBench-MMGenEdit,这是一个涵盖知识密集型图像生成和多图像编辑的双语基准测试。最后,基于 SFT 和 RL 的双面 后训练 配方改进了代理策略和图像后端。 WeAgent-MMGenEdit 共同使 30B 总数/3B 活动策略的性能优于类似大小的策略模型,并接近 1T 参数代理的性能。