GLM-5.3:中国实验室如何紧跟前沿步伐
GLM-5.3: How Chinese labs keep stride with the frontier
Z.ai发布GLM-5.3模型,目前仅限编程方案,即将上线API,两周后开放Hugging Face权重。该模型在多个benchmark上超越Moonshot AI的Kimi K3,部分测试超过Claude Fable 5或GPT-5.6-Sol,参数量约750B,仅为Kimi K3的三分之一。Z.ai称其仅扩展后训练(post-training),与GLM-5.2共享基础模型。文章回顾GLM系列历史,讨论中国实验室竞争力来源,并提及RL数据产业在中国兴起,Z.ai与清华大学关系密切,年收入达10亿美元。
杂务说明:我目前在外旅行,因此无法为本篇文章录制配音。编辑——我在邮件发出后,为中国数据行业增加了第五点内容。今天,Z.ai 发布了他们的 GLM-5.3 模型,目前仅在编程方案中可用,即将在其 API 上推出,两周后将在 Hugging Face 上开放权重。这个模型看起来非常出色,分数提升幅度相当惊人。在许多基准测试中,该模型已超越 Moonshot AI 的 Kimi K3,在某些测试中甚至超过了 Claude Fable 5 或 GPT-5.6-Sol。以下是一个更完整的对比:这使得该模型大致处于 agentic coding(智能体编程)基准的前沿,而参数量仅约 750B——只有 Kimi K3 的三分之一!Z.ai 的博客文章相当直白,开头便是一句大胆的话:我们为 GLM-5.3 所做的全部就是扩展后训练(post-training)。GLM-5.3 与 GLM-5.2 使用相同的基础模型,但后训练大幅扩展。粗略地说,Z.ai 在与 Kimi 的对比中似乎在后训练方面有优势,而 Kimi 更像是一件预训练(pretraining)杰作。此次发布后,引发了许多讨论,人们好奇中国为何能保持如此出色的表现?这么小的模型如何能与领先的美国公开模型匹敌?这些结果真实吗?
订阅
最简单的解释是,Z.ai 非常擅长他们所做之事——值得回顾的是,他们在这条模型路线上工作的时间比业内几乎任何人都长。以下是 GLM 模型的简要历史。
智谱AI成立——2019年
GLM(通用语言模型)——2021年3月——由清华大学数据挖掘/知识工程组 THUDM 发布。权重
GLM-130B——2022年8月——扩展版本。GLM-130B 至 GLM-4 的技术报告。权重
ChatGLM——2023年3月14日——首个聊天版本。权重
ChatGLM2——2023年6月25日——权重
ChatGLM3——2023年10月27日——权重
GLM-4——2024年1月16日——更名为 GLM;随后于6月发布开放权重的 GLM-4-9B。权重
GLM-5——2026年2月11日——最新主要代际。权重
今年6月22日发布的 GLM 5.2 是一个重大事件——发布数周后,我经常听到我认识的 AI 研究人员仍在使用该模型,因为它速度快(有些人在内部集群上部署该模型以获得比公开服务更快的速度)且简单(作为没有回滚等问题的模型,在前沿 AI 系统上工作时)。GLM-5.2 完全经得起炒作。我自己也曾经历过同样的否认阶段,心想“他们怎么做到的?这些模型肯定没有看起来那么好。”美国公司拥有如此巨大的资源领先优势,却似乎无法在能力上拉开差距,这有些令人不安。常见的答案是蒸馏(distillation),我已就此写过大量文章,但我认为这不是主要因素。关于这一点,最近有一篇论文展示了从前沿模型中提取推理轨迹的简单方法——这类技术中国实验室绝对可以大规模使用。我不明白为什么美国实验室没有更快地修补这种行为;相反,他们跑去向政府寻求政策帮助。这对我来说说不通。
Z.ai 的博客直截了当,与以 RL 为主导的训练机制相符。他们表示使用了“更多环境、更多样化的任务,以及在这些任务上投入更多的计算资源”。你不能简单地“蒸馏”出 RL 环境、大规模运行这些环境的基础设施,或有效混合它们的算法。
Interconnects AI 是一个读者支持的出版物。考虑成为订阅者。
那么,如果不是蒸馏,中国实验室是如何做到的?他们是在“刷基准”(benchmaxxing)吗?一个公认的 benchmaxxing 定义是让模型专注于测试集,使得真实世界表现与纸面分数有显著差异。决定因素更多是宏观层面的,而非技术层面(是的,技术细节确实重要,但很难在不同实验室之间区分):
- Z.ai 的发布周期可能只有几天,而不是 OpenAI 或 Anthropic 的几个月。非常非常可能的是,OpenAI 和 Anthropic 拥有比 Z.ai 和 Moonshot AI 好得多的内部模型。尽管如此,这些美国公司往往需要数月时间才向公众发布模型,这在前沿采用决策中极大地有利于中国实验室。简单来说——中国实验室利用美国实验室进行发布前测试的所有时间,继续在基准上攀爬(SpaceXAI 在这方面可能与中国实验室接近得多)。由于进展速度如此之快,这可能是中国实验室保持前沿地位的最大决定因素。到目前为止,这对美国实验室在经济上尚可接受,因为他们的模型仍有巨大需求。随着构建 LLM 的实验室内部模型自我改进循环加速,如果这些反馈循环中的任何一个需要用户数据,这种更快的发布周期可能极大地有利于中国实验室,使他们的产品在下一个更优越的模型出现之前拥有更长的生命周期,从而削弱对其模型的需求。
这些显然就是业内许多人担心的竞赛动态。既然有这么多实验室在前沿能力范围内构建模型,很难看到这种情况在近期内消退。
是的,Z.ai 可能比 OpenAI 或 Anthropic 更在意公开基准。这些基准,例如在 Artificial Analysis Intelligence Index 或类似聚合器上获得高分,对其股价有直接影响。他们在很多方面需要这样做以继续融资并保持团队士气,因为作为与 American giants 匹敌的斗志昂扬的弱者是一个绝佳的故事。微妙的 benchmaxxing 不一定源于绝望或类似压力。这在众多实验室中已是行业标准。许多公司的数据获取策略是在他们落后的基准上购买数据。Z.ai 并没有 benchmaxxing 到 GLM-5.3 被“烤焦”的程度(至少不是故意的,他们会检查这一点)。每个实验室目前都在应对扩展 RL 的粗糙边缘。Anthropic 的 Opus 5 和 Sonnet 5 模型尽管基准分数惊人,但声誉却褒贬不一。业内每个人都在同一条船上,所以有些模型权重比其他更容易使用,但他们发布博客中的基准分数是真实的。
GLM-5.3 可能比 Claude Fable 或 GPT Sol 更窄。当 GPT-5.2 发布时,除 agentic coding 外评价褒贬不一。与此同时,OpenAI 和 Anthropic 支持着拥有无数用例的大型企业。这是作为采用曲线早期公司的好处——你可以瞄准最有价值的用例。在后训练中,少在意一些事情会使组装最终模型变得容易得多。我有点夸大其词,因为据报道 Z.ai 凭借强大的本地部署业务达到了 10 亿美元的 ARR。同样,旗舰 GLM 模型一直没有视觉能力。纯文本确实帮助 Z.ai 获得更具竞争力的分数,但这也是一个竞争更激烈的领域。另一方面是像 Inkling-Small 这样的模型,它被设计为全模态的。
(补充)RL 数据产业正在中国起飞。我们关注的许多消息来源和传闻渠道都提到数据产业在中国如何起飞——很大程度上是由美国数据公司向中国模型实验室销售所驱动。这可能表现为中国实验室购买许多与美国前沿实验室使用的相同的 RL 环境,并更早发布下游 RL 后的模型。我们对该市场的规模和影响仍有很大的误差范围,但它肯定正变得重要。
Z.ai 是一个极其熟练的 LLM 组织——一个可能在计算效率上远超 OpenAI/Anthropic 的组织。这一点需要重复强调。这些人非常擅长他们所做之事。该公司与清华大学关系密切,那里有许多中国最优秀的计算机科学家。这个丰富而渴望的人才库对他们的成功至关重要,正如对任何西方同行一样。总的来说,他们用 GLM 系列模型执行的似乎是一个非常完美的策略。祝贺发布!我很期待权重发布,这样我就可以进行更长时间的测试(我倾向于使用像 Fireworks 或 Baseten 这样的美国开放权重推理服务)。
发表评论
这是朝着强大网络能力不可避免地在整个经济中扩散迈出的又一步。Z.ai 已承认这一点,表示:GLM-5.3 是我们迄今为止在网络安全任务上最强大的模型。它在漏洞发现、漏洞利用分析和复杂多步安全任务方面带来了显著改进。这些能力可以帮助防御者更早识别弱点、验证风险并加速修复。它们也带来了明确的双重用途风险。因此,我们采取分阶段发布的方式。选定的安全合作伙伴将首先在受控环境中评估 GLM-5.3。随后将提供更广泛的访问和 API 可用性。一旦必要的安全评估和发布准备完成,我们将发布 GLM-5.3 的完整模型权重。他们接着承认如何通过请求分类器和思维链监控(在模型对齐之上)来监控其平台上的推理。魔鬼在细节中,目前尚不清楚每个 AI 实验室在此的执行水平如何。能力扩散由最低共同标准决定。归根结底,当真正的开放权重即将到来时,这类安全措施几乎无关紧要。如果不是 GLM-5.3,那就是另一个模型。具有这些能力的模型规模正在随时间缩小,变得更容易修改和部署(可能没有防护措施)。Z.ai 做了一些正确的事情,包括推动更多漏洞发现和主动管理,但任何单一公司都远不能独自应对这一问题。我们需要由政府或行业联盟领导的产业级指导,立即为这一转型在所有软件中做好准备。