论文

Boogu-Image-0.1:通过在最低预算下的理解促进开放代理多模式生成

Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget

应用与实践内容创作

摘要

我们推出了 Boogu-Image-0.1,一个开源的统一多模态理解和生成模型系列,包括 Base、Turbo、Edit 和 Edit-Turbo 变体。它在高质量文本到图像生成、快速推理、基于指令的编辑和双语(中英)文本渲染方面提供了具有竞争力的性能。 Nano-Banana-Pro 和 GPT-Image-2 等闭源多模态系统通过系统级集成而不是单一模型实现了强大的性能,但其内部实践在很大程度上仍未公开。在这项工作中,我们证明,通过更强大的多模态编码器、代理提示重写和相关技术,再加上数据质量、训练管道和代理推理时间缩放的改进,加强系统的理解能力,即使在计算预算高度受限的情况下,也可以显着提高生成和编辑性能。综合评估表明,Boogu-Image-0.1 在标准基准测试中始终匹配或超越其他开源模型,并取得了接近领先闭源系统的结果。值得注意的是,这是仅用 2.0862 亿张独特图像就完成的。基础模型的理论训练成本仅为约 40 万美元。我们分享我们认为对更广泛的研究社区有价值的实际讨论,并在 Apache 2.0 下发布权重、代码和配方,以推进统一的多模式理解和生成的开放生态系统。我们的代码可以在这里找到:https://github.com/Boogu-Project/Boogu-Image。