Simon Willison · 博客

Kimi K3,以及我们仍能从鹈鹕基准测试中学到什么

Kimi K3, and what we can still learn from the pelican benchmark

二〇二六年七月十六日 · 英文原文

中国AI实验室Moonshot AI发布Kimi K3,宣称拥有2.8万亿参数,为“首个开源3T级模型”,目前通过官网和API可用,计划于2026年7月27日开放权重。其自报benchmark显示K3大多优于Claude Opus 4.8 max和GPT-5.5 high,但不及Claude Fable 5和GPT-5.6 Sol。Artificial Analysis评估指出,K3在私有长周期知识工作评估中Elo达1547,每任务成本0.94美元,输出token比K2.6减少21%。该模型在Arena.ai的Frontend Code arena排名第一。定价为输入token每百万3美元、输出每百万15美元,成为最贵的中国AI模型。

中国AI实验室Moonshot AI今日发布Kimi K3,称其为"迄今为止能力最强的模型,拥有2.8万亿参数"。该模型目前可通过官网和API使用,但承诺"于2026年7月27日"开放权重。Moonshot称这是首个"开源3T级模型"(大概是将2.8万亿四舍五入为3万亿),从DeepSeek的1.6T v4 Pro手中夺下桂冠。其自报的benchmark显示,K3大多优于Claude Opus 4.8 max和GPT-5.5 high,但不及Claude Fable 5和GPT-5.6 Sol。Artificial Analysis对该模型的报告中有几个亮点:"在我们的私有长周期知识工作评估中,Kimi K3整体Elo达到1547,比Kimi K2.6高出732分,仅次于Claude Fable 5。""每任务成本(0.94美元)与GPT-5.6 Sol(1.04美元)相近,约为Opus 4.8(1.80美元)的一半,高于开源权重同类模型。""Kimi K3在Artificial Analysis Intelligence Index上的token使用量显著下降,输出token比K2.6减少21%。"该模型目前在Arena.ai的Frontend Code arena中排名第一,甚至超越了Claude Fable 5。新模型的定价引人注目:输入token每百万3美元,输出token每百万15美元,与Anthropic的Claude Sonnet系列处于同一水平,成为迄今为止中国AI实验室发布的最贵模型。相比其早期模型如Kimi K2.6(0.95/4美元),价格大幅上涨。2.8万亿参数也是那个1T模型规模的两倍以上。但它的鹈鹕表现如何?我使用OpenRouter(避免注册Moonshot API密钥)配合llm-openrouter插件,生成了一只骑自行车的鹈鹕SVG:llm -m openrouter/moonshotai/kimi-k3 'Generate an SVG of a pelican riding a bicycle'。这是对话记录。结果如下:那只鹈鹕消耗了95个输入token和16,658个输出token(其中13,241个是推理token),总成本25美分!由于K3支持图像输入,我针对上面渲染出的SVG(使用我的alt文本提示)运行了一次,得到(成本0.6美分):"一只戴着红围巾的白色鹈鹕的卡通插图,沿着一条带有白色虚线的灰色道路骑着一辆红色自行车;鹈鹕有一个橙色的大喙和橙色的蹼足在踩踏板,身后有白色运动线条;背景显示浅蓝色天空中有白云、黄色太阳、两只飞翔的小黑鸟,前景有绿色草地和白色小花。"我们能从鹈鹕中学到什么?我的"生成一只骑自行车的鹈鹕SVG"测试已经存在21个月了。它从来就不是一个特别好的benchmark。起初它只是一个玩笑,用来讽刺比较这些模型有多么荒谬困难,但在第一年里,它却出人意料地与模型的实际质量有很强的相关性。现在这种关联基本已经断裂。GPT-5.6和Claude Fable 5的鹈鹕被GLM-5.2超越,尽管我很喜欢GLM,但我不认为它是Fable级别的模型。(我仍然不相信实验室会针对这个benchmark进行训练——如果真是这样,我期待更好的结果。不过,Gemini有可能针对动物与交通工具的任意组合进行了优化!)鹈鹕测试最大的局限在于,它完全没有触及当今模型最重要的方面:agentic工具调用以及随着对话长度增加可靠操作工具的能力。所以不要用鹈鹕来比较模型!尽管如此,我自己运行这个benchmark仍然能获得不少价值。首先,它是一个强制尝试模型的驱动力。如果我展示一只鹈鹕,意味着我已经成功通过它运行了一个prompt。如果模型有官方API,我会使用它;如果是开源权重(且小到能装进128GB M5 MacBook Pro),我会尝试在自己的机器上运行,通常通过llama.cpp、LM Studio或Ollama。我经常使用OpenRouter,因为它通常提供官方API的代理,无需我申请新的API密钥。我的大多数鹈鹕都是通过我的LLM CLI工具生成的,这有助于确保最新模型通过其插件得到支持。更重要的是,即使只是执行一个"生成一只骑自行车的鹈鹕SVG"的简单prompt,也能揭示模型的有趣特性。以今天的Kimi K3结果为例。运行这些简单prompt有助于强调该模型的几个特点。它目前只有一个推理强度级别"max"——结果也证明了这一点。模型消耗了13,241个推理token来输出3,417个token的回复。这很昂贵——这只鹈鹕花了25美分!为什么prompt"Generate an SVG of a pelican riding a bicycle"加起来只有95个输入token?OpenAI的tokenizer计数为10,Anthropic对Opus 4.6计数为10,对Opus 4.7计数为30,对Sonnet 5/Fable 5计数为25。向Kimi K3输入"hi"计数为86个token,表明可能存在85个token的隐藏系统prompt。不过它拒绝泄露这个prompt。视觉能力表现良好:生成的alt文本非常出色。K3目前只有一个思考强度级别,但我最近通过在不同强度级别下运行相同的鹈鹕prompt,快速了解这些级别的影响,获得了不少价值。例如,这是我为GPT-5.6模型系列制作的矩阵。实际上,我从鹈鹕测试中获得的主要收获是:这是一个对模型进行prompt的"hello world"练习;对简单任务的粗略成本和推理估算;确认模型能输出有效SVG,并具备基本的几何和空间意识。这对于在我笔记本电脑上运行的较小模型来说意义更大。在同一模型系列的不同版本之间比较鹈鹕仍然很有趣。K3的鹈鹕相比Kimi 2.5有了显著改进。这是一个我可以分享的东西,证明我已经尝试过它。此外,在Hacker News上,带有鹈鹕的评论现在几乎成了一种传统,每当我迟到时,总会有评论问鹈鹕在哪里!

标签:ai, generative-ai, llms, llm-pricing, pelican-riding-a-bicycle, llm-release, ai-in-china, artificial-analysis, moonshot, kimi

译自 Simon Willison · 博客 · 录于 二〇二六年七月十六日