Kimi K3:开源权重升级
Kimi K3: The open-weights escalation
月之暗面于7月16日发布旗舰模型Kimi K3,为2.8万亿参数MoE模型,权重将于7月27日开源。K3在Vals AI指数排名第二,Artificial Analysis智能指数第三(仅次于Claude Fable和GPT-5.6 Sol Max),前端代码竞技场第一。月之暗面以较少资源与Anthropic、OpenAI竞争,成为最强开源模型。中国开源策略获习近平在WAIC上公开支持,阿里巴巴宣布将开源2.4万亿参数Qwen 3.8。中美模型性能差距从6-9个月缩短至3-5个月。
7月16日(周四),月之暗面(Moonshot AI)发布了其最新旗舰模型Kimi K3。K3是一个2.8万亿参数的MoE模型,其权重将于7月27日发布。本文大部分内容是对生态系统现状的反思,前提是月之暗面信守权重发布日期的承诺。这是一种对均衡状态的更极端看法;如果实际情况是中国拥有同样强大但闭源的模型(即K3从未发布),那么许多结果最终会落在一个中间地带。关键事实是,无论是开源与闭源模型之间的性能差距,还是美国与中国模型之间的性能差距,都已从备受争议的6-9个月缩短到更短的时间,比如3-5个月。从发布材料来看,K3显然是一个真正的前沿模型。它将是自DeepSeek R1以来,开源模型最接近前沿的一次。DeepSeek R1是另一回事。那是一家中国实验室极其迅速地转向推理模型,并比许多美国公司更快地发布了一个模型。Kimi K3则是一个中国实验室在已知领域(数据、算法、架构、工具、环境等)执行规模化的例子。Kimi K3在Vals AI指数上总体排名第二,在Artificial Analysis的智能指数上总体排名第三(仅被Claude Fable和GPT-5.6 Sol Max击败,同时价格更低),在前端代码竞技场(Frontend Code Arena)上总体排名第一,还有其他令人印象深刻的结果。月之暗面正在以远远少得多的资源与Anthropic和OpenAI正面竞争。这显然是有史以来发布的最强开源模型。审视这个模型应该能清楚地看到,即使来自美国闭源前沿模型的对抗性蒸馏(adversarial distillation)有所贡献,其程度也至多相对较小。那些关注蒸馏恐慌并得出错误结论(认为中国AI实验室仅靠知识产权盗窃才能产出好模型)的AI观察者,即将迎来觉醒——中国公司在构建模型方面,与领先的美国公司一样出色。月之暗面正在解决OpenAI或Anthropic人员正在解决的许多相同问题。我相信会有更多关于蒸馏的讨论和压力,但证据已经表明,中国公司能做到的不仅仅是快速跟进。在我访问中国期间与Kimi核心团队会面时,我清楚地感受到他们拥有令人难以置信的文化,有人称之为“气场”,以及在GPU受限环境下的表达自由。在构建模型如此依赖规模化的游戏中,构建好模型的能力很大程度上仍归结于个人的执行力、动力和表达。访问过他们之后,这个结果就不那么令人惊讶了。我访问过许多AI公司,很少有公司能拥有如此立即可感知的文化。与此同时,中国的AI应用趋势起步晚于美国。因此,虽然所有中国实验室的计算资源都比美国同行少得多,但其中更多的资源确实可以用于训练。当我开玩笑说OpenAI的普通研究员能拥有多少计算资源——比如几千台H100等效机器——时,Kimi的研究员们都震惊了。构建Kimi模型的组织架构和方法无疑反映了这一点,但如果没有大量专有信息,很难梳理出具体面貌。当前峰值模型性能的状况大致如下:
- Anthropic – Claude Fable 5
- OpenAI – GPT 5.6 Sol
- 月之暗面 – Kimi K3(开源权重*)
- SpaceXAI – Grok 4.5
- 智谱(Z.ai) – GLM 5.2(开源权重)
- Meta – Muse Spark 1.1
- DeepMind – Gemini Flash 3.5
- 阿里巴巴 – Qwen 3.7 Max(已宣布3.8版本,撰写本文时也将开源权重)
看到DeepMind和其他一些美国巨头排名如此之低,令人震惊。从很多方面来看,X AI团队值得更多赞誉。以下是Artificial Analysis的可视化摘要:
这次发布以及近期的其他事件,导致了开源与闭源模型之间最可能结果的平衡方向发生了重大转变。我将逐一分析。从很多方面来看,这感觉像是一个新时代的开始。一个竞争更加激烈,但同时也更需要协调的时代,因为我们正在全球范围内推广极其强大的技术。
分享
1. 中国重新承诺开源AI——展示了对近期风险的不同解读
许多人是在相对近期才开始关注中国AI领域的,因此他们可能得出“开源发布模型是其核心策略”的结论。事实上,我认为大多数实验室的核心策略更接近Anthropic或OpenAI——构建尽可能最好的智能。多年来一直关注并与中国实验室互动后,我认为他们最初转向开源发布模型的最佳解释是实用性。他们需要开源发布模型以获得采用、关注和反馈(尤其是在高价值的湾区市场)。长期以来,中国关于开源AI角色以及“国家层面策略”的政策非常有限。据我所知,没有高级领导人公开评论过开源AI。本周这也发生了变化,习近平在世界人工智能大会(WAIC)上发表了主旨演讲,非常直接地承诺中国AI生态系统的未来将走向开源和全球扩散。这一对现状的承诺,恰逢迄今为止最强开源权重模型发布之际,是现代AI早期历史上的一个明确标志。这发生在一个中国AI行业许多潜在前进路径被广泛讨论的时期——他们会保持开源吗?他们能在规模化上跟上美国实验室吗?中国是否存在一个不断增长的收入市场?在这些讨论中,焦点一直是中国对风险的容忍度、公司的变现能力,以及任何与公司停止开源发布其最佳模型密切相关的理由。通过将习近平的承诺与一个非常强大的模型在时间上联系起来,中国含蓄地表达了其在发布开源权重模型方面的风险容忍度。就目前而言,这是对中国体系内对诸如强大网络安全能力(或生物危险)等主题感知风险的一种解读。最简单的解释是,中国政府肯定在密切关注模型带来的潜在风险——很可能在技术范围上比美国政府的“氛围式监管”更广——并且如果测量到风险就会采取行动。简单的解释是,他们不认为当前的前沿模型具有重大风险。与此同时,中国的经济决策者认为推广AI应用是好事,这样他们可以在之后通过该行业获利——在扩大分发之后(正如中国近年来在汽车、太阳能、先进制造业和许多领域所做的那样)。在美国AI媒体经历了数月对Claude Mythos模型的炒作和恐吓之后,这些可能会显得有些令人震惊。这种惊讶应该是一个很好的现实基础——世界并非一致认同我们在美国听到最多的关于AI的叙事。
2. 开源模型作为前沿实验室的经济“阿喀琉斯之踵”
许多引导AI讨论的叙述者都有明确的动机来压低最佳开源AI模型的感知能力。Dean Ball——他个人支持开源模型,但现在在OpenAI工作——发表了一篇关于Kimi的反思文章,获得了广泛评论,其中他对开源模型发表了以下看法。理解这一陈述很重要,因为它聚焦了开源模型在AI建设经济方面的角色。Dean说:
- 开源权重模型本质上是减速主义(decelerationist)的,我不断感到惊讶的是,所谓的“加速主义者”(accelerationists)竟然对开源权重模型如此兴奋。解释为什么开源权重模型是一种减速主义形式,对于理解即将到来的世界秩序至关重要。
他是对的。对于前沿实验室来说,开源模型在经济上是减速主义的,这将减缓AI的净投资和资本支出(capex)部署。这是因为强大的开源权重AI模型极大地降低了闭源实验室的利润空间。这有两个影响。首先,AI实验室用于再投资未来模型的利润减少了。其次,市场认为这些公司的终值更低,因此会削弱它们未来的融资轮次。这些因素加在一起会减缓最具变革性AI模型的时间线,但我认为它们不足以阻止OpenAI和Anthropic成为世界上估值最高的几家公司。对我来说,这些对社会总体是好事。因为开源权重模型降低了获得特定性能水平智能的入门价格,从而加速了AI在经济中的扩散。开源模型也鼓励定制化。问题是,这种扩散本质上比前沿AI实验室的产品(直接销售给开发者使用的工具)慢得多。开源模型的潜力在于,几乎每家企业都可以使用它们来构建特定领域的agent。这种经济扩散需要极其漫长的时间!我曾将此描述为开源权重模型起步慢得多,但可能具有更大的指数级增长。问题是,如果闭源模型在原始能力上领先太多,这种定制化的能力就可能变得毫无意义。我认为,扩散的增加和AI实验室权力集中的减少,对AI转型非常有利。它给了我们更多时间去解决新能力的难题,并让更多利益相关者影响故事走向——任何一家公司在安全地控制世界上最重要的技术方面都很可能出现问题。当然,对我来说,在这个世界上,最好的模型仍然由美国公司制造是很重要的,这将使美国能够控制技术及其价值观的轨迹。我也预计情况会如此,因为美国拥有更愿意投资AI的更大资本市场(以及不断增长的利润份额),但这并非必然。
Interconnects AI 是一份由读者支持的出版物。考虑成为订阅者。
3. 中国的效率优势
Kimi的发布博客包含一些技术细节,证实了我们感受到的持续模型改进的类型。举一个例子:Kimi K3 建立在 Kimi Delta Attention (KDA) 和 Attention Residuals (AttnRes) 之上,这是两项旨在改善信息在序列长度和模型深度上流动的架构更新。我们还扩大了混合专家(MoE)的稀疏性,在与 Stable LatentMoE 框架配合使用时,有效激活了896个专家中的16个。结合改进的训练和数据配方,这些结构变化使得与 Kimi K2 相比,整体规模化效率提升了约2.5倍,使模型能够更有效地将计算转化为智能。训练效率确实会累积。它们将导致模型持续取得令人难以置信的进步。顺便提一下,追踪这项特定创新在生态系统中的路径是一个有趣的例子。Kimi Delta Attention (KDA) 是在 Kimi Linear 论文中引入的,该论文类似于用于 Olmo Hybrid(我在 Ai2 的最后一个 Olmo 模型)的 Gated DeltaNet。Qwen 的最新模型切换到了相关架构,最近的 Nemotron 模型也是混合型的(但仍更接近 Mamba 而非 Gated DeltaNet)。看到像这样主要由学术界推进的新架构想法如此迅速地转化为前沿规模的模型,真是太棒了。Gated Delta Networks 于2024年底推出,建立在 Mamba 的思想之上。到2026年中期,它们已出现在前沿模型中。我选择关注这个例子,部分原因是 Kimi 团队为模型之间的创新给出了一个很酷的数字,但主要是为了给关于中国资源效率的更广泛讨论留出空间。越来越清楚的是,中国实验室的资本效率要高得多。在一个规模定律(scaling laws)规定智能与有效资本(用于购买计算、数据和人才)成正比的世界里,这可能是你的AI行业所能拥有的最大优势。对于为什么会这样,有许多可能的解释,例如中国研究人员的薪酬较低,但在解决LLM研究难题方面更有效率,但我们可能永远无法得到如此具体的原因。自从写下关于中国的笔记以来,我听到了更多关于中国新兴数据产业的消息(远不及Anthropic数十亿美元的数据预算),以及中国实验室能够获得有意义的训练计算资源(通过规避出口管制)。中国公司没有同样的推理需求(直到最近,月之暗面不得不暂停新用户订阅其K3模型——API仍然可用),因此他们更多的计算资源可以用于训练。这些领域严重影响了实验室能力的真实性,但我们对此的衡量非常有限。实际情况是,这些中国实验室筹集的资本比美国AI生态系统的任何一部分都少几个数量级。最直接的比较对象是OpenAI和Anthropic,它们拥有略好的公开模型。其他公司,如Google和Meta,拥有商业史上最大的现金流,但在构建模型方面却落后了。至于美国的新实验室,情况更具竞争性——Thinking Machines 最近发布了他们的第一个模型 Inkling,该模型很强,但无法与 Kimi K3 相提并论。这些拥有更多资源的美国公司仍然可以迎头赶上,但你需要认真权衡我们拥有的模型质量的公开衡量标准,而不是诉诸希望——这往往反映了偏见。如果中国实验室确实拥有潜在优势,他们可以继续利用这一点来构建比所有竞争对手都更强大的模型!许多结果都是可能的,K3 应该会提高大多数人对中国在不久的将来,凭借更高效的训练努力,能够直接领先AI能力的概率——即使这不是你最可能预测的结果。资本效率的一个很大贡献者可能在于方法上:美国实验室花费大量精力以戏剧性的大步推动前沿,而中国实验室更专注于追赶——这种追赶成本更低。正如在蒸馏中,学生模型通常可以超越教师模型(不限于中国实验室的对抗性蒸馏)一样,“努力追赶”而非“发明下一个范式”的方法可能会导致更强大的模型。
4. 不断增长的前沿开源模型生态系统
在 Kimi K3 发布后的那个周末,在我撰写本文并广泛讨论这些事件时,阿里巴巴宣布即将推出一个2.4万亿参数的 Qwen 3.8 模型,并将开源权重。历史上,阿里巴巴一直通过其云业务仅以API形式提供其最大模型,因此这是另一个重大的氛围转变,为开源模型经济的下一章打开了大门。即使该模型在基准测试上落后于 Kimi K3,它也表明中国公司可能不仅维持其开源模型策略的现状,而且正在进一步深入。如果这个 Qwen 3.8 模型很快发布,即在下一个 Gemini 模型之前,它可能会将 Google 推至拥有最智能模型的实验室排行榜上的第八位——而中国在这个榜单上的排名一直在攀升。还有其他关于即将推出更多强大中国模型的传言,DeepSeek V4 预计将从其“预览”版本毕业。
发表评论
5. 前沿开源权重政策漫长故事的开始
我认为,如果 Claude Mythos 今天作为开源权重模型发布,负面结果将相对较小。这是一个有点难以坚持的观点,因为我们拥有的公开网络安全评估非常有限,而且这是一个复杂的生态系统(并且因为我信任 Anthropic 的许多人)。我仍然坚持这个观点。风险被过度炒作。问题是,对于最强的AI模型来说,情况并非总是如此。更强大的模型即将到来——随之而来的是更大的风险——因此,让最好的模型以受控、闭源的方式比类似的开源权重模型早几个月被访问,是一个极其安全的均衡状态。用户可高度控制的开源权重模型总会到来——你无法有效禁止数字产品,尤其是来自不良行为者的——因为AI训练已被证明比许多分析师预期的更具全球可及性。尽管如此,在我撰写本文时,美国政府继续尝试采取更多旨在限制美国开源权重模型的措施。最新消息来自 Axios: 幕后:一位接近政府的人士告诉 Axios,商务部去年曾考虑将多家中国AI实验室列入其“实体清单”,这将有效地切断未经许可的美国访问。该人士称,国家安全局和白宫国家网络总监办公室去年也曾考虑就中国AI实验室的威胁发布咨询意见,实际上劝阻美国公司使用他们的技术。该人士补充说,白宫曾考虑实施一项行政命令,规定美国公司只有在能够保证安全并在发生安全漏洞时承担责任的情况下,才能托管中国模型。另一位接近政府的人士表示,商务部去年夏天还在政府内部传阅了利用其权力确保国内供应链安全以针对中国开源模型的规则草案。
这将使美国处于一个非常不对称的状态:美国最好的模型在网络安全任务上有护栏,但全球行为者可以访问优秀的中国开源权重模型来探测我们的防御。这只是众多例子之一,表明禁止开源权重模型不仅损害了AI的自由市场,而且在短期内使生态系统更不安全。还有其他非常糟糕的结果,例如减缓AI应用和AI研究的扩散,正如我上面讨论的那样。这些均衡状态非常难以维持,尤其是在AI工具加速模型进步的情况下,但在开源和闭源之间维持这种现状很重要。拥有一个在能力上真正独步前沿的模型——比如 Mythos 刚宣布时——同时又是开源权重的,这在我们进入未知能力领域时会带来严重风险。模型将进步得非常快,衡量其全部能力也变得越来越困难。然后我们陷入了一个试图在开源模型问题上走钢丝的世界。不希望如此强大的东西瞬间在全球扩散是合理的,但与此同时,模型的制造者有动机炒作其能力,而他们的竞争对手则有动机炒作其风险。这一切都归结于仔细的衡量和对社会风险向量的主动加固。这场政策辩论、模型发布和激烈反应的疾驰列车只会从今天开始继续下去。自去年12月 Claude Opus 4.5 发布(将我们推向了 agentic 路径)以来,我们一直处于快速进步的列车上,所有关于AI应该如何发展的关键想法都在被检验。在此做出正确决策的关键是评估能力,独立于拥有最大财务利益的公司。因此,当我们进入AI治理的AGI时代时,所需的众多行动之一,是采取类似“曲速行动”(Operation Warp Speed)的方法来提升国家能力(以及其他独立行动者),使其能够准确评估模型并研究新兴风险。
结论:警钟
开源权重模型通过加速能力的扩散,极大地放大了AI的好处和潜在坏处。目前,前沿语言模型的坏处很大程度上仍是假设性的,但情况不会一直如此。让开源权重模型略微落后于闭源前沿,是我们缓解风险的自然缓冲。关键在于,我们必须集体行动,在潜在危害出现时加以缓解,无论开源权重模型落后3个月、6个月还是9个月,这仍然是一个非常短的时间线。如果我们对开源权重模型进行严厉监管,我怀疑世界上的大部分地区会因此麻痹,认为我们不再需要采取行动。我们所做的只是稍微推迟了不可避免的事情——开源模型最终将跨越所有关键能力门槛,无论其合法性如何。理解和受益于这种开源-闭源之舞,必须是AI社区在未来几年内,跨越所有权力和影响力领域的集体行动。Kimi K3 是一个分水岭时刻,因为前沿开源权重模型现在已成为现实。许多关于开源权重模型风险真正所在的假设将受到检验——我怀疑其范围会比许多人预期的更窄,并且AI的许多风险仍将通过闭源和“更安全”的API扩散。对这些风险的评估将随着AI在我们经济中整合的加速而及时演变。我们不能只取其一,我们将继续两者兼得。由此,2025年是开源模型开始被更认真对待的一年——尤其是当中国以如此明显的领先优势跃升时——因为人们意识到,世界将不会是单极的,只有美国的闭源AI实验室决定轨迹。2026年则是之前讨论过的、由于真正前沿的开源权重模型而带来的潜在风险和加速真正落地的一年。
1 回应的很大一部分是针对第四点,该点将开源模型的必然结果比作AI共产主义,我认为这偏离了重点。具体来说,不加解释地使用“共产主义”一词导致了大量反弹。