Boogu-Image-0.1:提升开源统一多模态理解与生成
Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation
来自 Boogu
摘要
我们推出 Boogu-Image-0.1,一个开源的多模态统一理解与生成模型系列,包含 Base、Turbo、Edit 和 Edit-Turbo 四个变体。该系列在高质量文生图、快速推理、基于指令的图像编辑以及中英双语文本渲染方面均展现出有竞争力的性能。像 Nano-Banana-Pro 和 GPT-Image-2 这样的闭源多模态系统,其强大性能主要源于系统级集成而非单一模型,但其内部实践大多未公开。在本工作中,我们证明:通过对模型理解能力、数据质量和训练流程进行针对性改进,并结合基于 agent 的推理时扩展(inference-time scaling),即使在计算预算极为受限的条件下,也能显著提升生成与编辑性能。全面评估显示,Boogu-Image-0.1 在标准 benchmark 上持续达到或超越其他开源模型,并取得接近领先闭源系统的结果。值得注意的是,这些成果仅使用了 2.0862 亿张独立图像。基础模型的理论训练成本仅约 40 万美元。我们分享了我们认为对更广泛研究社区有价值的实践讨论,并在 Apache 2.0 许可下发布权重、代码和配方,以推动多模态统一理解与生成的开源生态发展。代码地址:https://github.com/Boogu-Project/Boogu-Image。
译自 Hugging Face · Daily Papers · arXiv:2607.13125 · 录于 二〇二六年七月十六日