我们介绍了 Boogu-Image-0.1,这是一个开源的统一多模态理解与生成模型系列,包括 Base、Turbo、Edit 和 Edit-Turbo 变体。该模型在高质量的文本到图像生成、快速推理、基于指令的编辑以及中英文双语文本渲染方面表现出色。
与闭源的多模态系统如 Nano-Banana-Pro 和 GPT-Image-2 不同,后者通过系统级集成而非单一模型实现强大性能,但其内部实践仍然 largely undisclosed。本研究表明,通过针对模型理解、数据质量和训练流程的改进,以及推理时的代理扩展,可以在高度受限的计算预算下显著提升生成和编辑性能。
全面评估显示,Boogu-Image-0.1 在标准基准测试中持续与其他开源模型相匹配或超越,且其结果接近领先的闭源系统。值得注意的是,这一切是基于仅 208.62 万独特图像实现的。基础模型的理论训练成本约为 40 万美元。
我们分享了我们认为对更广泛研究社区有价值的实用讨论,并在 Apache 2.0 下发布了权重、代码和配方,以推动统一多模态理解与生成的开源生态系统。我们的代码可以在这里获取:Boogu-Image GitHub。
博主点评: Boogu-Image-0.1 的推出标志着开源多模态模型领域的重要进步,其在性能和成本上的高效平衡为研究人员提供了更多可能性,尤其是在资源受限的情况下。