最新开放模型动态(#23):Laguna S2.1、Inkling 与 Kimi K3 展现开放模型在帕累托前沿的实用性
Latest open artifacts (#23): Laguna S2.1, Inkling, & Kimi K3 show the utility of open models on the Pareto frontier
整合被视为AI实验室的必然趋势,但当前更多公司投入数亿至数十亿美元训练模型并开放发布。Thinking Machines的开放模型微调服务年收入数亿美元,其Inkling模型(975B-A41B MoE)支持多模态输入。腾讯发布Hy3(295B-A21B MoE)并改用Apache 2.0许可。DeepSeek更新V4-Flash-0731,在帕累托前沿击败Luna。Moonshot发布Kimi-K3,采用非商业许可。美团发布LongCat-2.0(1.6T参数),完全在昇腾910上训练。
整合一直是许多敏锐观察者预测的训练模型实验室近期发展路径之一。随着训练成本每年以数量级增长,整合被视为不可避免的趋势。然而,作为在2024年曾预测整合将在2026或2027年真正加速的人,我们现在处于何种境地?我们看到的是更多公司在训练强大模型——总投入轻松达到数亿至数十亿美元——并且越来越多的组织在开放发布这些模型。对token的需求极高,随着模型效率提升并解锁更多潜在用例,这一需求很可能继续增长。我们曾认为需要整合的所有这些实验室,如今意识到构建token机器是一条通往价值的可能路径,而随着时间推移,更多公司将识别出这一价值来源。最典型的例子是Thinking Machines——当他们在2025年2月宣布成立公司时,很少有人会将其归入开放模型公司之列,包括我自己。如今,他们的开放模型微调服务每年创造数亿美元收入,并且发布了美国境内构建的最佳开放权重模型——领先于早期领跑者NVIDIA的Nemotron和Arcee的Trilogy。在生态系统的另一端,中国实验室保持持续步伐,像小米这样的新进入者仍在更广泛的AI经济中积累影响力。在长期预测整合之后,现在更稳妥的赌注似乎是预测持续采用,并尝试想象开放模型在其中扮演的角色。像Kimi K3这样的收入分成许可能坚持多久?开放模型能占据多少市场份额?我们正进入决定性时代。这是我们迄今为止最丰富的开放模型回顾之一,我们对此感到兴奋!
我们的精选
- Inkling by thinkingmachines:Thinking Machines的首个模型是一个975B-A41B多模态MoE,支持文本、图像和音频输入,并生成文本输出。虽然它不是同类规模中(在中国)最强的模型,但它定位为微调的绝佳基础,例如通过其商业产品Tinker。他们还发布了一个较小的版本(276B-A12B),在其规模下极具竞争力。
- Hy3 by tencent:腾讯推出的295B-A21B MoE。它在所有指标上均优于前代。然而,最值得注意的是许可变更:之前的版本(见Artifacts 21)使用自定义且相当严格的许可,而腾讯此次发布改用Apache 2.0。该模型还成功证明了一个50年前的数学问题(借助专用测试框架并以Sol作为评判者,尽管后者的重要性尚不明确)。
- Laguna-S-2.1 by poolside:Poolside迅速崛起,成为Artifacts的常客,这是其连续第三个月亮相。S2.1是118B-A8B MoE的新预训练和后训练版本,可适配DGX Spark,这为其带来了大量关注。Poolside还采用了OpenMDW许可,这是一种类似Apache 2.0的自由许可,但针对AI模型具有更好的法律支持。该公司在其博客中提供了更多细节,包括所有评估轨迹。对于开放模型发布而言,这是极高的透明度!
- DeepSeek-V4-Flash-0731 by deepseek-ai:就在OpenAI将其最小模型价格下调80%的一天后,这家“鲸鱼”发布了其V4 Flash模型的更新,在帕累托前沿上击败了Luna。更大的模型尚未更新,因此其性能表现仍有待观察。对于最初的V4版本,Flash版本在每参数性能方面表现出色,而Pro版本则相对平庸。
- Kimi-K3 by moonshotai:这是近期最大的开放模型发布,我们在单独的文章和播客节目中进行了报道。它采用非商业许可发布,要求推理和微调提供商签订商业协议。Kevin Xu和Graham Webster在一篇文章中认为,这些许可可能为未来政府针对与中国AI公司开展业务的美国实体采取行动提供依据:但如果一家美国公司需要与Moonshot签订合同以提供Kimi K3生成的推理token,情况就不同了。美国官员及其他人士曾讨论的某些潜在政策工具,作为限制中国开放模型使用的杠杆,将更明确地适用。
模型
通用目的
- LongCat-2.0 by meituan-longcat:中国的DoorDash又回来了。这次,该公司发布了另一个拥有1.6T参数的大型MoE。虽然该模型在基准测试之外并非同规模中最强,但它完全在昇腾910上训练,使其成为首个非华为、非玩具级、完全在中国加速器上训练的大型模型。其他中国芯片大多仅用于推理(如果有的话)。
- Laguna-XS-2.1 by poolside:Poolside小型(33B-A3B)MoE的更新。
- Motif-3-Beta by Motif-Technologies:韩国Motif推出的314B-A13B MoE预览版。这是该公司迄今为止最具雄心的模型,因为其规模显著增大,并引入了GDLA和mHC等架构创新。
- Apertus-v1.5-70B by swiss-ai:对完全开源的Apertus 1.0进行持续预训练,额外使用了2T token。
- Instella-MoE-16B-A3B-Think by amd:AMD在Instinct显卡上训练的16B-A3B MoE。AMD还提供了从基础到SFT检查点的所有不同阶段,以及MidTrain和DPO。