Interconnects · Nathan Lambert

GLM-5.2 是开放智能体的阶跃变化

GLM-5.2 is the step change for open agents

二〇二六年六月二十二日 · 英文原文

2026年6月13日,Z.ai向GLM编程计划成员发布开放权重模型GLM-5.2,随后于6月16日以MIT许可证公开权重。该模型在Arena智能体排行榜上成为唯一能与OpenAI和Anthropic最新模型竞争的开放模型,并在Design Arena中击败Claude Fable。社区基准测试结果超出预期,被多位AI评论者比作DeepSeek R1时刻。GLM-5.2在Claude Code框架中作为通用智能体表现良好,为开放权重模型提供了可信替代方案,引发对中美AI性能差距及开放模型监管的讨论。

整理说明: 继上周我发布了一篇关于博客现状的帖子,提到付费功能略有增加后,现在是个好时机提醒大家,我提供团体订阅服务,折扣幅度随座位数增加而增大。此外,我今天还发布了一篇关于终端智能体开放RL配方的新论文,详情可点击此处阅读。

大约一周多前,当AI界仍因Claude Fable 5令人震惊的出口限制及实际禁令而动荡不安时,Z.ai发布了其最新模型GLM-5.2。该模型于6月13日(周六)异常地向GLM编程计划成员推出。这是一种不寻常的发布惯例——通常,AI模型在周末发布都出于奇怪的原因(最著名的例子是Llama 4)。¹ 在此案例中,Z.ai似乎急于利用“Anthropic反开放科学”的时代精神,后者对AI研究人员实施了无声的限制。过去一两年里,中国的开放权重实验室抓住了每一个像这样轻松赢得营销的机会。

GLM-5.2,按照行业通用的命名惯例,看起来像是继热门模型GLM-5.1之后的一次增量更新。此时,Kimi模型的创造者Moonshot AI与GLM模型的创造者Z.ai,已凭借AI研究人员中最受欢迎的开放权重模型,巩固了声誉市场的顶端地位。随后发生的事,是追踪AI模型时常见的一课:微小的版本号变化,可能意味着AI模型跨越了有意义的用户体验门槛。基准测试和训练中的微小改动,能开启一系列全新的用例。

随之而来的是对GLM-5.2缓慢而渐进的炒作浪潮。官方采用MIT许可证的模型权重和发布博客,在首次推出三天后,即6月16日才公布。人们可以罗列许多技术细节,例如强劲的基准测试分数、Z.ai使用的非常流行的RL框架(SLIME)、始终建议在最大思考力度下使用该模型等等,但最初的发布博客通常不是关注的重点。你可以等待并观察生态系统的反应,来判断它是否货真价实。毕竟,如今的基准测试已半死不活。

6月16日随之而来的是一系列社区基准测试,显示GLM-5.2的结果超出预期。Arena的智能体排行榜显示,它是唯一能与OpenAI和Anthropic最新模型一较高下的开放模型(值得注意的是,它在无思考模式下匹配了Opus 4.8,而GLM-5.2则使用了最大模式)。这只是GLM-5.2在众多评估中击败Gemini的案例之一,但那是另一个话题了。在一个社区(尤其是实际设计师)看法不一的设计基准测试Design Arena中,GLM-5.2甚至击败了Claude Fable本身——那个最近被禁的炒作机器!几乎所有我尊敬的AI评论界和研究人员,在亲自使用后都称赞了这个模型。社区中如此明确的讨论焦点,此前只在一次开放模型发布时出现过——DeepSeek R1。这个比较我并非轻率做出,当我将Kimi K2的发布比作“DeepSeek时刻”时,GLM-5.2已经远远超越了那个时刻。Kimi K2令人印象深刻之处在于,开放模型性能的巨大进步似乎可能来自中国的任何地方。而GLM-5.2所迈出的一步,更像是AI进步的一扇单向门。Anthropic凭借Claude Code实现创纪录的收入增长率,很大程度上得益于它是能做这件事的最佳模型,也是唯一真正能做到的模型。GLM-5.2是众多即将推出的开放权重模型中,第一个提供可信替代方案的。

这种平行关系非常清晰,就像DeepSeek R1曾展示的那样,资源少得多的开放权重实验室也能复制OpenAI凭借o1所倡导的思维链推理模型。随着AI系统变得越来越复杂,构建成本越来越高(涉及工具、集成框架和规模化模型权重),GLM-5.2这样的时刻本非必然发生。关键在于,GLM-5.2是那个在编码框架中作为通用智能体感觉恰到好处的开放权重模型。它是第一个。

我个人早就该尝试一些最近的同类模型,比如Kimi K2.7或GLM-5.1,但这次的炒作太过强烈,我无法忽视。我让它投入工作,在Claude Code中使用Fireworks的API为我的训练后课程制作内容(设置过程非常简单)。过程中遇到一些小麻烦,比如Claude Code框架或我的仓库文档试图向模型发送图像,这会导致Fireworks API在该会话中失效——需要手动清除上下文。总体而言,模型能力立刻感觉对路,我仍在摸索该使用哪个框架和推理提供商。

更多炒作信息:你可以看看Z.ai创始人告诉Elon“开放权重的Fable能力将在2027年第一季度之前到来”,Vercel CEO表示“对@zai_org的GLM-5.2在编码方面的出色表现感到由衷的印象深刻,甚至震惊。这改变了格局”,以及更多来自我深表尊敬的人士和我不太熟悉的人士的评论。

Interconnects AI 是一份由读者支持的出版物。考虑成为订阅者。

那么,这是一个好模型,这让我们处于何种境地?有许多趋势在起作用。首先,让我们立足于开放与封闭模型的能力差距。我曾写过,如果开放模型在Claude Code中跨越Opus 4.5的门槛,我预计从2026年初左右开始会出现“使用量激增”。现在,我们就在这里。Claude Opus 4.5于2025年11月24日发布,到GLM-5.2于2026年6月16日发布,时间间隔为204天——约6.8个月。这正好落在许多人声称的美国封闭实验室与中国开放实验室之间6-9个月的性能差距范围内。写下这些时,我感到惊讶。随着美国实验室在过去大约一年里如此迅速地提升算力,我曾预期性能差距会随时间扩大。这条轨迹上另一个非常有意义的步骤将是Claude Fable 5的发布——与Claude Opus模型相比,它更依赖于规模,因此也依赖于最先进的GPU。

尽管如此,这并非一个令人满意的答案。继续解析这条轨迹需要比我在这篇路标文章中能容纳的更多细微差别。其最直接的意义在于,对正在最大化token使用量的组织而言,将带来远为严重的定价压力,将Anthropic的收入推向新高。有人预测Anthropic无法实现其预测的ARR数字,但我认为这并未考虑到这些模型的真实需求以及不可避免的增长。这个模型的存在对开放模型经济是一个巨大的福音。所有像Fireworks、Together、Thinky(通过Tinker)、Prime Intellect以及任何其他销售开放模型推理或微调服务的公司,都刚刚触及了另一个拐点。其影响需要很长时间才能扩散到更广泛的经济领域(和用例中)。工作流程正变得越来越复杂,人们使用不同的模型进行规划、主要编码和子智能体调度。

我预计炒作将继续升温,而且,嘿,当我在周日晚上写下这些时,我可以预见周一媒体和市场的反应会像DeepSeek R1发布时一样。这种扩散发生在Anthropic(以及延伸开来,美国的旗舰模型)仍被禁的情况下,是一把严重的经济匕首。GLM-5.2正被给予时间来蚕食前沿实验室的经济腹地,而后者正想推进到只有绝对前沿模型才能实现的更高利润、更高收入的领域。这种经济担忧呼应了AI领域多次出现的故事,因此尚不清楚它何时会真正扎根。

感觉更关乎AI发展轨迹的对话,是关于开放模型的监管和控制。我认为廉价智能的广泛传播是经济上的好事,我们的默认立场应该是为开放模型欢呼,但该模型的发布日期将使其在AI权力结构的心智地图中,永久地与Claude Fable——进而与Claude Mythos——联系在一起。我们正处于这样一个节点:美国政府认为Mythos级别的模型能力发布不安全,而中国的模型制造商却在向所有人开放的能力上全速前进。这些趋势线不一定存在因果关系,因为我们不知道GLM-5.2与其前身相比的网络性能如何,但能力肯定是相关的。如果情况不变,这指向一种可能性:美国政府可能认定某个特定的中国开放权重模型对公众不安全。这里还有许多其他潜在情景,但明确的是,我们在描绘这些情景、准备基础设施以及向社会传递信息方面,还有很多工作要做。需要远不止我一人来想象并向决策者传达一个世界,告诉他们如何管理能力日益强大的开放模型。²

我们还有数年的AI进步在前方,英伟达的下一代芯片已投入生产,算法也在不断进步。对开放模型倡导者来说,这似乎是一条狭窄的道路,但我们需要找出如何让它们可行,这样性能的巨大飞跃才不会只流向封闭模型。我完全理解想象一个可公开访问的Mythos级别模型为何令人恐惧,但如果现在开放模型被禁,而只有一两家公司手中的封闭模型在两年内变得好上10倍或100倍,我认为我们将面临更大的问题。

¹ 中国实验室发布模型的速度之快一直让我印象深刻。我从多个实验室听说,模型完成训练后,将权重公开上传到HuggingFace的时间可以用小时而非天来衡量。这至少已经有所放缓,因为他们现在需要准备将模型服务于更广泛的推理市场。

² 需要更多讨论的一点是,即使是封闭模型(例如Mythos预览版)也经常落入未经授权的用户手中或被越狱。因此,在访问权限上的开放与封闭二分法并非完全非黑即白。

译自 Interconnects · Nathan Lambert · 录于 二〇二六年六月二十二日