最新开放成果(#22):Zyphra、Cohere 和 Poolside 拓展生态广度
Latest open artifacts (#22): Zyphra, Cohere, and Poolside are expanding the breadth of the ecosystem
开源模型生态正变得更加多样化,参与者从一年前以中国公司为主,扩展到全球小众公司。主要类别包括:纯粹模型制造商(如DeepSeek、智谱、Poolside、Mistral)、大型科技公司(如阿里巴巴Qwen、谷歌Gemma、英伟达)及产品公司(如JetBrains、Krea)。近期发布亮点包括:英伟达发布Nemotron-3-Ultra-550B-A55B-BF16,采用OpenMDW许可证;CohereLabs在Apache 2.0下发布218B-A25B MoE模型Command A+;zai-org发布GLM-5.2;Zyphra发布ZAYA1-74B-preview;poolside发布Laguna-M.1并承诺继续开源。此外,moonshotai、stepfun-ai和英伟达也分别更新了Kimi-K2.7-Code、Step-3.7-Flash及Nemotron-Labs-Diffusion-14B。
我们在开源模型发布中持续观察到的一个趋势是,生态系统正变得更加多样化,越来越多的组织发布各种模型。一年前,开源制品及更广泛的开源模型领域主要由少数(中国)参与者主导。如今这一格局已经改变,我们越来越多地看到全球各地的小众公司崭露头角。虽然很难确切了解这些公司自身的动机,但我们可以大致观察到以下几类:
- “纯粹”模型制造商:这些公司的明确目标是训练处于前沿或至少接近前沿的模型。这包括许多中国公司,如 DeepSeek、智谱(Zhipu)和 MiniMax,也包括西方公司如 Poolside、Arcee 和 Zyphra。此外,主权 AI 参与者也在增多,例如 Cohere、Sovereign、Mistral 和 Trillion Labs。最近的 Mythos 事件唤醒了一些政策制定者,这可能导致对主权模型训练的兴趣增加。
- 大型科技公司:对于大型科技公司,包括阿里巴巴的 Qwen、谷歌的 Gemma,以及某种程度上英伟达(NVIDIA),其动机更加多样化。阿里巴巴通过发布模型来推销其闭源模型,而英伟达则受益于繁荣的开源模型生态系统,因为这增加了对其 GPU 的兴趣和使用。这种既得利益与 Llama 时代的西方开源模型不同,当时开源发布的动机不太明确(并且最终未能持续)。
- 产品公司:一些公司,如 JetBrains、Zed、Krea 和 Photoroom,主要销售以 AI 为核心组件的产品。由于它们不想被切断访问闭源模型的途径,或者希望提供独特的功能,它们可以训练高度专业化的小型模型来满足产品需求。因此,将这些模型权重开源并不会损害它们的利润。
这种制造商和模型的多样性符合我们的假设:更多公司将开发长尾模型,而追逐绝对开源前沿的公司数量将会减少。
分享
虽然并非每次模型发布都能完全归入这些类别,但更广泛的观点是,开源模型开发并非由单一类型的参与者或动机驱动。这种多样性是开源生态系统的优势之一,这可以从模型发布的技术报告中看出,这些报告重复使用了其他开源模型发布的训练方法、架构选择和数据。试图减缓或禁止这个生态系统不仅是徒劳的(正如技术相关禁令的历史所表明的那样),而且是不安全且反自由的。此类限制会将 AI 开发和使用集中在少数人手中,最终危及局外人自由采用我们这一代最重要的技术之一的能力。
我们的精选
- NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 by nvidia:Nemotron 系列的大版本,使用 LatentMoE 使其比同类模型更快。与其他 Nemotron 模型一样,绝大多数数据都是开源的。最重要的是:英伟达承诺使用 OpenMDW 许可证,该许可证专门针对模型权重(和数据)定制,并放弃了其自定义许可证。虽然 MIT 和 Apache 许可证与 OpenMDW 精神相同,但只有后者真正涵盖了模型权重,而前者是软件许可证,并不真正适用于模型权重。
- command-a-plus-05-2026-bf16 by CohereLabs:Cohere 最近越来越频繁地出现在 Artifacts 中,他们在 Apache 2.0 许可证下发布了其旗舰模型 Command A+。该系列之前的版本是在非商业许可证下发布的,因此这一变化非常受欢迎!Command A+ 结合了多模态、多语言和 agentic 能力,是一个 218B-A25B MoE 模型,使其可以在单个 B200(使用 4-bit 时)上使用。
- GLM-5.2 by zai-org:本次 Artifacts 中最大的新闻是 GLM-5.2,我们也在单独的博客中介绍过。该模型继续令人印象深刻,并且确实可用于日常工作,与目前最好的闭源模型相比没有太大的性能倒退。有趣的是,自发布以来的原始下载量与其他模型发布更一致,GLM-5.2 发布后的下载量大致与 GLM-5 持平。
- ZAYA1-74B-preview by Zyphra:Zyphra 在 AMD GPU 上进行训练,因其技术报告中有趣的架构选择而被称为研究界的内行推荐。他们发布了一些新模型,其中 74B-A4B MoE 和 8B-A0.6B MoE(技术报告)是当前的旗舰版本。
- Laguna-M.1 by poolside:我们在上一期 Artifacts 中介绍过的 Poolside,也在 Apache 2.0 许可证下发布了其旗舰模型!他们还承诺未来将继续进行开源发布:“开源权重现在是我们的默认选择。我们将继续朝着前沿迈进,并开源发布越来越强大的模型。”
通用模型
- Kimi-K2.7-Code by moonshotai:Kimi 的更新,重点在于 token 效率。
- Step-3.7-Flash by stepfun-ai:Step-Flash 的更新,在数学方面尤其强大。
- Nemotron-Labs-Diffusion-14B by nvidia:一个实验性模型,可以在三种不同模式下使用:自回归、扩散和自推测。每种模式适用于不同的用例。了解更多