Simon Willison · 博客

GLM-5.2 或为最强纯文本开源权重 LLM

GLM-5.2 is probably the most powerful text-only open weights LLM

二〇二六年六月十八日 · 英文原文

中国AI实验室Z.ai于6月13日向代码计划订阅者发布GLM-5.2,6月16日以MIT许可证开放完整权重。该模型为753B参数、1.51TB的混合专家(Mixture of Experts)架构,40个参数为激活参数,上下文窗口达100万token。Artificial Analysis Intelligence Index v4.1上,GLM-5.2以51分领先MiniMax-M3(44分)、DeepSeek V4 Pro(max,44分)和Kimi K2.6(43分),但每个任务输出token消耗43k,高于其他模型。该模型在Code Arena WebDev排行榜排名第二,仅次于Claude Fable 5。OpenRouter上输入收费$1.40/百万token,输出收费$4.40/百万token。

中国AI实验室Z.ai于6月13日向代码计划订阅者发布了GLM-5.2,随后于昨日(6月16日)以MIT许可证发布了完整开放权重。该模型规模与之前的GLM-5和GLM-5.1相当,是一个753B参数、1.51TB的庞然大物——采用混合专家(Mixture of Experts)架构,其中40个参数为激活参数。GLM-5.2是纯文本输入模型——Z.ai拥有独立的视觉模型系列,最新代表是GLM-5V-Turbo,但该模型未开放权重。GLM-5.2的上下文窗口为100万token,较GLM-5.1的20万token有所提升。

该模型引发了强烈关注。运行着最受尊敬的独立基准测试之一的Artificial Analysis表示:GLM-5.2是Artificial Analysis Intelligence Index上领先的开放权重模型。在Intelligence Index v4.1上,它以51分领先于MiniMax-M3(44分)、DeepSeek V4 Pro(max,44分)和Kimi K2.6(43分)。不过他们发现该模型相当消耗token:GLM-5.2每个任务使用的输出token多于其他领先的开放权重模型——每个Intelligence Index任务使用43k输出token,高于GLM-5.1的26k,也高于MiniMax-M3(24k)、Kimi K2.6(35k)和DeepSeek V4 Pro(max,37k)。

该模型目前在Code Arena WebDev排行榜上排名第二,仅次于Claude Fable 5。该排行榜衡量的是"前端Web开发任务,包括agentic编码工作流"。考虑到它缺乏图像输入,看到它排名如此之高令我印象深刻——我原本错误地认为图像输入是构建真正优秀的前端编码模型的关键部分。

我通过OpenRouter试用了该模型,该平台提供了来自9个不同提供商的接入,几乎所有提供商对输入收费$1.40/百万token,输出收费$4.40/百万token。作为对比,GPT-5.5是$5/$30,Claude Opus 4.5-4.8是$5/$25。

出色的鹈鹕,令人失望的负鼠

GLM-5.1曾为我生成过最爱的鹈鹕和史上最爱的负鼠(针对提示词"生成一只骑电动滑板车的北弗吉尼亚负鼠的SVG")。有趣的是,在这两种情况下,模型都选择返回包裹在HTML文档中的SVG,并额外使用CSS添加了动画。

让我们试试GLM-5.2。对于"生成一只骑自行车的鹈鹕的SVG",我得到了这个:这是一个自包含的全动画SVG,动画效果完美无缺!我经常看到眼睛脱落或车轮与自行车分离旋转的情况,但这里一切都运行良好。鹈鹕的矢量插图也非常精美。令人印象深刻。

遗憾的是,"骑电动滑板车的北弗吉尼亚负鼠"的效果远不如预期:这比GLM-5.1差太多了!提醒一下,那只负鼠长这样:5.2甚至没有尝试为其添加动画。

标签:ai, generative-ai, llms, pelican-riding-a-bicycle, llm-release, openrouter, ai-in-china, glm

译自 Simon Willison · 博客 · 录于 二〇二六年六月十八日