NeFut Logo NeFut
EN 管理员登录

[AI学术] Boogu-Image-0.1:开源统一多模态理解与生成的突破

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:19
#AI #Open Source #Multimodal

我们介绍了 Boogu-Image-0.1,这是一个开源的统一多模态理解与生成模型系列,包括 Base、Turbo、Edit 和 Edit-Turbo 变体。该模型在高质量的文本到图像生成、快速推理、基于指令的编辑以及中英文双语文本渲染方面表现出色。

与闭源的多模态系统如 Nano-Banana-Pro 和 GPT-Image-2 不同,后者通过系统级集成而非单一模型实现强大性能,但其内部实践仍然 largely undisclosed。本研究表明,通过针对模型理解、数据质量和训练流程的改进,以及推理时的代理扩展,可以在高度受限的计算预算下显著提升生成和编辑性能。

全面评估显示,Boogu-Image-0.1 在标准基准测试中持续与其他开源模型相匹配或超越,且其结果接近领先的闭源系统。值得注意的是,这一切是基于仅 208.62 万独特图像实现的。基础模型的理论训练成本约为 40 万美元。

我们分享了我们认为对更广泛研究社区有价值的实用讨论,并在 Apache 2.0 下发布了权重、代码和配方,以推动统一多模态理解与生成的开源生态系统。我们的代码可以在这里获取:Boogu-Image GitHub

博主点评: Boogu-Image-0.1 的推出标志着开源多模态模型领域的重要进步,其在性能和成本上的高效平衡为研究人员提供了更多可能性,尤其是在资源受限的情况下。

原文链接: https://arxiv.org/abs/2607.13125

[h] 返回首页