开源模型回顾:Kimi K3 更多细节、Qwen 3.8、习近平 WAIC 演讲、蒸馏、开闭源差距及未来展望
Open models recap: more on Kimi K3, Qwen 3.8, Xi's WAIC speech, distillation, the open-closed gap, and what's next
Nathan Lambert与Florian Brand在播客中讨论开放模型生态现状,重点分析Kimi K3、GLM 5.2等中国模型的表现及其追赶前沿的原因,包括资本效率、人才专注与计算资源增长。他们指出开放模型在agentic编码等任务上已接近封闭模型,但前沿领域仍由封闭模型主导。关于蒸馏,Lambert反驳了Ben Thompson认为RL阶段蒸馏更有效的观点,强调RL需要定制评分模型而非依赖外部API。两人预测2025年底中国实验室(Kimi、智谱、DeepSeek、Qwen)将保持领先,美国公司(英伟达、Thinking Machines)可能进入紧密竞争者行列。
激动人心的消息!我的书——试图与世界分享后训练知识——已经完成,即将发货。可在 Manning 或 Amazon 订购。感谢支持。它目前是 Amazon 上排名第一的 AI 书籍 :)。Nathan 和 Florian 坐下来讨论开放模型领域发生的一切。继上周 Kimi K3 发布后,感觉一切都在加速——美中地缘政治、开放与封闭模型的经济学、AI 前沿的安全问题等等。章节:00:00 欢迎与背景 04:38 使用 Kimi K3 的体验 08:53 GLM 5.2 的持续角色 12:47 中国模型为何如此优秀?17:41 数据、环境与中国实验室巡礼 19:47 中国提供商概览:Qwen、DeepSeek、MiniMax… 24:08 美国开放模型生态系统 30:25 前沿与近前沿,以及反对禁令的网络安全案例 34:58 蒸馏与 Ben Thompson 的辩论 44:12 预测与前沿层级列表 48:36 总结 可在 Apple Podcasts、Spotify 以及你收听播客的任何平台收听。其他 Interconnects 访谈请点击此处。分享 更多教育性后训练视频,请参见我正在整理的课程。 文字稿 00:00:06 Nathan Lambert: 好的,欢迎回到 Interconnects。我们正在进行季度开放模型综述,主要是调侃或解释——不是调侃——为什么那么多关于蒸馏的观点是错误的,并了解当前局势。我认为上周四是 Kimi K3 发布的日子。我认为在不久的将来我们会看到更多进展。这似乎不可避免。比如上周末,习近平发表了讲话,直接承诺将开放和开源作为一项战略。这不是一个详细的布局。Qwen 宣布他们的下一个大模型将是开放权重的,这是一个重大变化。我认为有很多东西可以深入探讨。Flo,你似乎已经对性能差距和蒸馏观点有所看法。所以我们可以从那里开始,然后我手头有一个小列表,我们可以逐一讨论我写的博客中的话题,这些话题都非常微妙。所以我认为我们有无限的话题可聊。继续吐槽吧。 00:01:17 Florian Brand: 是的,我认为,每次模型发布——至少每次开放模型发布——最大的问题就是它落后于封闭前沿多少个月。人们喜欢给这个数字一个明确的定义,这真的非常混乱,因为现在我们有这么多不同的 benchmark 提供商,以及这么多不同的 benchmark,每个网站——我对此也不无辜——都会拿出他们最喜欢的 benchmark 来证明当前模型或新发布的模型处于前沿,然后另一方又会拿出另一个 benchmark 来反驳,显示它实际上落后了一年或更久。很多讨论似乎都围绕着这个问题:开放模型落后了多少个月。 00:02:26 Nathan Lambert: 是的。所以我的观点是,有些 benchmark 实际上与人们正在做的事情相当相关,比如 agentic 编码和 agentic 计算机使用任务,而有些 benchmark 则与长尾相关,我认为 Claude 和 GPT 在这方面非常有价值。但问题是,Claude Code 和 Codex 现在的市场是什么?如果是软件工程,那么模型在这方面落后几个月可能是一件非常非常大的事情。然后我怀疑这个模型会没问题——免责声明:模型权重据称要到 7 月 27 日才发布,很多讨论都基于它们会发布的假设。但人们很可能可以通过后训练让这个模型在许多这些人们想要的利基领域匹配 Opus 和 GPT。我认为,观察——我们俩对后训练开放模型行业有不同的看法——但在让这些模型针对特定高价值任务进行微调方面,有大量的进展和兴奋点。历史上,这通常是在 Qwen 和 GLM 的混合体上完成的,而 GLM 5.2 真正加速了这一进程。我很好奇第一个发布博客说“我们在我们的任务上微调了 Kimi K3”的人会是谁,因为我打赌你能获得巨大的提升。我认为,即使你比我更多地使用 Kimi K3,我的直觉是,由于它的规模扩大如此之大,它的后训练可能会有些粗糙,这通常意味着它还有很多性能可以挖掘。 00:04:03 Florian Brand: 是的。运行、运行、运行,尤其是后训练会非常困难,因为你只需要一个 B300 节点就能加载权重,这在规模上太疯狂了。所以可能需要一些时间,而且我听说需要大量的工程工作才能让它达到可微调的状态。但人们想讨论使用这个模型,比如你实际上注册了编码程序并使用过它。所以把这个拿出来作为背景是好的。 00:04:38 Nathan Lambert: 是的。所以我在发布后第二天左右注册了 200 美元的套餐,这是他们最大的套餐,与其他类似,但他们也有 40 美元和 100 美元的套餐。但最大的套餐有 100 万上下文,而且我感觉在 API 请求方面也有优先级,因为很多人在网上说他们不断遇到 API 错误,而到目前为止,我可以说我过得还不错。就模型能力而言,除了前端非常出色之外,它在某些方面确实表现出色。甚至在我的一些研究任务中——比如在 Interconnects,我们现在有超过一年的开放模型数据——我让前沿模型提出一些有趣的分析,我们以前没做过,因为我们自己做分析并发表。我让它们做点新东西,基本上给我惊喜。很多模型或前沿模型,或者说基本上所有模型,都会抓住我们做过的事情,重新做数据分析部分,然后做一些奇怪的深奥部分。Kimi K3 做了一些更有趣的事情。我明确告诉它去爬取 Reddit,然后它找到了一些我甚至没考虑过的子版块,然后发现,例如,Reddit 上的讨论比下载量通常起飞的时间早一两个月,或者它们发现有趣的模型比下载量起飞早一两个月。它们都关注 Qwen,然后人们下载更多 Qwen 模型。这类分析是开创性的,但这是 Kimi 让我惊讶的地方,相比所有其他前沿模型。一个简单的问题:你能用它来完成你大部分的核心工作吗?比如你有一堆任务分布,你大部分用 Codex 完成,我认为你是个 Codex 用户而不是 Claude 用户。你认为维恩图的重叠部分有多大,这个模型会在哪些地方表现良好? 00:07:24 Florian Brand: 这真的取决于我给它多少自由度。我现在看到 Kimi K3 的主要问题是,我正在开发我们公司在 Prime Intellect 做的框架。我发现 Kimi 的主要特点是它的代码简单得多,这使得它更易读,但它缺少一些 Codex 能做到的东西,或者说,我们说的是 56、55,尤其是 54 的水平。所以我会说 Kimi K3 在这些任务上大约是 54-55 的水平。但如果我阅读代码,我会说“这真是好代码”,然后我用 Codex 过一遍,它会发现所有那些它不擅长的利基情况。但对于监督运行或运行一些实验来说,它实际上非常可用。对于一些其他利基事情,你可以直接让它运行。一个缺点是——但这也是因为 API 完全被用户淹没,而且他们的服务器在中国。挂钟时间明显比 GPT 长得多。但我会说,如果我强迫自己每天的工作流程中使用它,我会变慢,但不会慢到让我说“好吧,这没法用”。 00:08:53 Nathan Lambert: 那和 GLM 5.2 相比如何?因为在我看来,GLM 5.2 的故事仍在展开。比如我会在旧金山转悠,人们会说“是的,我真的用它来做这部分 agentic 编码和/或工作流程”。你属于使用 GLM 的那一类人吗? 00:09:20 Florian Brand: 是的。我也使用过 GLM,主要是因为我们有一个内部端点,速度非常快,或者在那之前,我也使用过一个 API,每秒大概有 200 或 300 个 token。如果你能以足够好的水平快速完成很多任务,你就会使用那个模型,而不是去 Codex 选择较差的模型,再选择正确的推理努力,再选择快速模式。我就直接用 GLM,得到相同的结果,而且效果很好。它的能力绝对达到了 Sonnet 的水平,对于很多清理任务或只是苦力活,它真的很管用。我会说,对于很多工作,你可能可以用 Kimi K3 作为主要 agent,用 GLM 做子 agent 工作,就能走得很远。 00:10:24 Nathan Lambert: Kimi 的公告和模型的规模有一些不同之处。我认为这些开放模型需要更长的时间才能真正优化并在推理提供商中可用。比如 GLM 5.2 相当快,但第一,我们还没有权重,第二,我认为它的采用速度不会像 500B、700B MoE 那样快。我认为那里会有更多问题,这是一个非常不同的情况。过去,中国模型会完成它们的 RL 运行,并在几小时到几天(可能一周)内发布开放权重的模型,然后生态系统立刻就知道如何处理。我认为在这个下一规模的开放权重模型上,基础设施的提升要大得多,我认为我们必须考虑到这一点。封闭实验室在宣布模型之前就在幕后做了这些工作。所以这有点像在操纵时间差,可能人们需要额外一个月才能真正后训练并在工作流程中大规模使用 Kimi。我们这些开放权重粉丝喜欢说“只有在封闭模型可用时,你才能计算时间差”,但现在开放模型中也出现了类似的动态:Kimi API 完全崩溃了。供应太多?需求太多?供应不足?所以这个模型并没有像我想象的那样立即扩散。我只是在思考这与性能时间差的关系。 00:11:54 Florian Brand: 这是事实,但另一方面,开放生态系统在过去几个月里已经专业化了相当多。在最初推出时,它们都会有一些合作伙伴,这些合作伙伴事先拥有权重。它们现在会在几天甚至几周前就发布 vLLM 补丁,这与一年前完全不同,那时权重被丢出来,模型制作者说“好吧,你们自己搞定”。所以我预计第一天的一般可用性会相当不错,然后所有提供商开始竞赛,优化以获得越来越高的速度,因为这关乎声望。 00:12:47 Nathan Lambert: 是的。好的,两个方向。为什么我们认为中国模型能这么好?我想我写过,在 Epoch 的 JSD 在我们的 Discord 中有一场辩论,我认为非常好。我在我的文章中有这一部分,我逐渐认为中国实验室的资本效率更高,你可以将资本转化为计算、数据和人才,从而使模型更好。我认为这非常重要,如果这真的是某种结构性优势的话。无论原因是什么,我认为原因可能是人才受过更好的训练,无论他们的教育体系如何,都是为了解决使 LLM 更好的问题。也可能只是中国的计算、人才和一切成本都更低。无论是补贴,还是平均工资较低。但当我们不断迭代模型时,这是一个非常重要的问题。如果下一代模型对 Anthropic 来说成本是 100 亿美元,但对 Kimi 来说只有 40 亿美元,这可能会非常巨大,但原因尚不清楚。例如,我认为 Kimi 的工程师 Big Eagle 回复了我的推文,他说“这有帮助,因为我们不是试图推动前沿,我们只是试图追赶”,这真的可能是一种心态问题,即中国实验室的目标范围是如何设定的,使得他们构建这些模型的成本低得多。但在过去一年里,我们问了很多问题,比如中国模型是否会掉队。我曾认为,由于这种训练的资本密集性,封闭和开放模型之间的差距会扩大,但看起来情况正朝着相反的方向发展。这很难解释,但你同意实验室比我们预期的更能跟上吗?我是说中国实验室,为什么? 00:14:43 Florian Brand: 嗯,我实际上看了我们基于去年总结对今年的预测,我们基本上说差距将保持在几个月内。所以这个预测似乎基本成立。幸运的是,我们没有给出具体数字,是 3 个月、6 个月还是 9 个月。所以我们在那方面是安全的。但我认为,我们俩在中国与这些人交谈时的普遍感觉是,研究人员本身是两三百人的团队,都是 20 多岁,只想把一个模型做得非常好。他们似乎不做任何支线任务,不做任何偏离这些事情的事。在计算方面,这对我们来说是一个很难回答的问题,尤其是随着中国芯片现在开始上线。我也认为芯片走私在过去 6 到 9 个月里大幅增加,或者被走私的芯片开始上线。 00:15:58 Nathan Lambert: 走私是绕过出口限制的通用术语。如果芯片在马来西亚,他们正在使用它们,我认为这类似。我认为这在过去 6 到 9 个月里大幅增加,这是部分结果。你这么说,但我只是想指出,我认为他们确实比训练上一代模型时拥有更多的计算资源。 00:16:24 Florian Brand: 是的。为了提供背景,两周前,LongCat 发布了他们的模型,他们声称——我们知道这很可能属实——完全在中国芯片上训练。他们没有公开指定是哪些芯片,但人们猜测是华为的昇腾。随着国内生产增加,它们可能主要用于训练,但尤其对推理有用,而推理也是训练中非常重要的一部分。所以他们可能在训练部分混合使用英伟达和其他芯片,在推理部分使用越来越多的国产芯片,这在训练阶段非常重要。所以我认为他们的总体计算资源在增加,而且他们实际上没有很多用户。所以他们不需要像 ChatGPT 那样为 10 亿用户提供动力,也不需要像 Anthropic 那样服务数百或数千家企业,因为他们没有那么多付费客户。 00:17:41 Nathan Lambert: 是的。而且我认为即使是那些付费客户,至少在企业方面,当你支持这些东西时,也会有公司时间和闲聊。即使你不是研究人员,即使这不是你的工作,它也会改变公司的注意力。如果 SSI 推出一个好模型,那将是最终验证,证明分心是个问题,但这是题外话,我们可以等等。我认为数据与环境行业也开始在那里出现。你还记得具体的吗?因为我们在中国时,有点震惊他们似乎很少利用外部数据。所以仅仅几个月后,在我们 4 月旅行之后,到了 7 月,我们就听到了一些事情,比如中国的新公司想购买数据等等。这真是一个有趣的时间线,看看事情如何变化。 00:18:40 Florian Brand: 我会对他们实际告诉我们的事情加上误差范围。 00:18:44 Nathan Lambert: 因为时间太近了,我不知道。 00:18:49 Florian Brand: 是的。那可能是真的。但这类事情很难确定。但我会说,购买外部数据似乎正成为一个更重要的因素。这将帮助开放模型赶上封闭模型,如果他们以折扣价购买相同的数据,因为他们稍后才购买数据环境。但这确实是一个因素。至于有多大,我们不知道。我们没有公开的见解,我怀疑我们也不会从任何人那里得到这些见解。所以这绝对是为什么他们能够赶上或提高模型分数的原因之一。 00:19:47 Nathan Lambert: 好的,其他中国模型提供商概览。我们谈到了 Kimi,谈到了智谱/GLM。我认为很快会有更多非常好的 GLM 模型。他们可能会称之为 GLM 5.5。Qwen,我们谈到了他们最大的模型即将到来。我会说,Qwen 最大的模型相对于其小模型的卓越性,在绝对性能排名上并不相同,这可能是专注的成本。我认为这与云公司有关。这几乎就像,如果你眯着眼看,它几乎就像 Google。Qwen 有阿里巴巴,这里有如此多的机会,让开发者通过这些小模型与阿里巴巴 Qwen 关联起来,对他们的云来说是一个巨大的机会,我认为他们在这方面非常成功。但他们的大模型一直不如小模型那么出色。所以我不期望他们的模型能像 Kimi K3 或 GLM 5.2 那样具有突破性。我预计它会被新闻覆盖,作为中国开放模型巨头发布巨量模型,但我不认为它会像 DeepSeek 那样成为一个持续的新闻故事。 00:21:01 Florian Brand: 有趣的是,我不知道你关注了多少,但他们有一个端点可以用于预览版,并且他们每天更新这个端点,所以他们有非常快的迭代周期,因为我们在所有这些 Twitter benchmark 上看到了进展。所以很多 SVG 和 three.js 这类视觉生成任务,模型在过去几天里改进很大。所以他们找到了一种快速反馈机制,其他公司也有。我们知道这一点,Cursor 有很多关于他们如何快速迭代的博客。但他们似乎不断上传新的 checkpoint 并使其可用。 00:21:47 Nathan Lambert: 但我同意。我猜这就像他们最终 RL 运行中的一个时间门控。在他们的 RL 运行结束时仍在轻微改进,他们只是勾选了这个框。 00:22:03 Nathan Lambert: 好的。Qwen DeepSeek V4 应该会发布预览版。关于 DeepSeek V4,我认为 flash 模型实际上更受欢迎,这是他们较小的模型,似乎是人们的绝对主力。所以我认为那是他们值得关注的模型。我不期望 V4 Pro 会有戏剧性的突破。这类似于任何事情,比如如果小米很快发布新的 MiMo Pro 模型,我不期望它会像那样大的发布,但它可能会是一个非常扎实的模型。只是很难知道。他们仍然是一个相当新的进入者。MiniMax,我认为,在玩不同的游戏。我不认为 MiniMax 在追逐 Kimi/GLM 那种通往 AGI 的登月计划氛围。 00:22:46 Florian Brand: 哦,我不同意这一点。 00:22:49 Nathan Lambert: 你认为 MiniMax 还在这个游戏中? 00:22:52 Florian Brand: 是的,我认为他们看到了紧张局势,尤其是因为他们是一家像 GLM 一样的上市公司。如果你看看过去几天的股票表现——天哪,那些股票——这似乎产生了巨大影响。有趣的部分将是许可证,因为他们已经多次更改许可证,变得越来越严格。如果在习近平讲话之后,他们再次改变主意,看看 MiniMax 是否会回到完全开放的许可证会很有趣。看看 K3 的许可证是什么也很有趣,因为他们说过会开源,但我不认为他们对实际许可证做过任何承诺。 00:23:45 Nathan Lambert: 是的。我的意思是,这非常重要。是的,我们拭目以待。零一、美团、LongCat 类似,非常强大的模型,可能在内部获得了大量价值。没有同样的开发者突破。所以,那是七八个中国实验室。我可能忘记了一些。我们也可以谈谈美国实验室。另外,Gemini 3.6 flash 发布了。看起来还行。就像一个小小的提升。更快了,话少了,但没什么大不了的。我们不会再分享这个了。这就是 Gemini 在我们这里得到的提及量。但我确实认为值得谈谈美国生态系统。我认为有一些新兴玩家。Thinking Machines 发布了他们的第一个模型。我和他们中的一些人谈过。他们非常致力于弄清楚如何用 Tinker 制作一个可微调的模型,我认为这是一个我非常推荐大多数开放模型构建者关注的研究领域。我认为如果你能在那里获得心智份额,你将获得大规模采用,因为更重要的是为实际任务可微调,而不是拥有最好的数字。所以这是他们的 Inkling 模型,一个一万亿参数的模型,分数不错但并非前沿。我认为有点像 DeepSeek V4,他们计划发布一个更小的模型,总参数只有四分之一,性能非常好。如果 Inkling small preview 在几周内发布,我确实认为那将是一个被广泛使用的模型。对于自动化任务和特定领域任务来说,这是一个很好的尺寸,可能不像 Kimi 和 GLM 5.2 那样的通用 agent 类型,但我认为这非常适合他们的业务。我知道美国的一些较小玩家,比如 Arcee 今年早些时候发布了他们的模型,仍在继续。Poolside 已经开始发布一些模型。他们在过去几个月里发布了一些,并且似乎准备在此基础上发布更多模型。所以他们真的在努力。Reflection 永远处于“模型即将推出”的状态,如果他们真的致力于开源,他们最好发布一些模型或代码之类的东西,以便开始启动开发者飞轮。发布模型很难。我和 Thinking Machines 的一些人谈过,感觉像是“哦,那很多,实际做起来工作量很大”。英伟达也在继续。我认为他们现在是稳定的玩家。他们继续发布模型。他们很快就会发布更多。他们发布了很多数据。我在督促他们尝试发布 Qwen 风格的小模型,比如 Gemma。Gemma 只有这些 Qwen 竞争模型,非常受欢迎。Gemma 模型在尺寸或架构上有点杂乱,但 Gemma 模型在采用率上确实与 Qwen 模型相匹配。我不确定它们是否易于用于研究,这可能需要时间。可能需要多次迭代。现在很多语言模型研究都是围绕小型 Qwen 模型和基于 Qwen 的模型设计的,这需要时间。人们非常了解如何使用这些模型以及研究结果。所以我希望 Gemma 能继续推出,并能在那个利基市场竞争。我不知道我在这里漏掉了谁。 00:27:22 Florian Brand: 不,我认为两者都是大玩家。模型创建者方面正在变得更广泛。去年,除了 Gemma 3 和 GPT-OSS,我们还有其他发布吗? 00:27:41 Nathan Lambert: GPT-OSS 2 会很厉害,显然还有 Nemotron。哦,还有年初的 Llama 4,但我不想让它被遗忘。但我们看到越来越多的玩家现在加入并以令人难以置信的速度推出模型。 00:27:59 Florian Brand: 比如 Poolside 在过去两三个月里发布了三四个模型。他们似乎找到了一种相当一致地推出模型的方法。这也是我们在开源方面看到的情况。我们谈到 GLM,我认为他们模型发布的迭代时间现在在 1 到 2 个月之间,每次新迭代都变得更好,这与封闭实验室的做法非常相似——我们现在大约每 6 周得到一个新的 GPT 或新的 Claude。所以,就拥有足够好的 pipeline 来发布越来越强的模型而言,开源生态系统已经真正搞清楚了,或者看似搞清楚了。 00:28:59 Nathan Lambert: 是的,我同意。这很有希望,但也很有趣,美国生态系统开始发布一些模型,然后习近平在话筒前,还有这两个模型。要赶上真的很难,因为训练人们实际使用的模型需要大量的机构专业知识。我认为这是现在发布模型的美国公司正在意识到的:这些不仅仅是刷 benchmark、蒸馏、窃取 IP 的模型。这些是真正的好模型,人们正在用它们来对比自己的内部训练 benchmark,然后看到在可衡量的事情上击败它们有多难。我认为我从一些美国训练模型的人那里感受到了这种情绪,就像有一些……我认为人们应该在尺寸和可微调性上进行创新,并尝试利用这个非常接近本土的潜在市场,但每家公司都面临着巨大的压力,要发布一个可以声称是前沿的模型。我认为投资者期望这些玩家中的许多人都能做到这一点,他们正在尝试做一件非常困难的事情。看看未来一年美中平衡如何发展将会很有趣。 00:30:25 Florian Brand: 是的,我认为总的来说,我和其他很多人已经讨论过整个生态系统,这也是你在开头谈到的。我认为我们越来越多地看到模型能力的分化:对于很多任务来说,当前的前沿模型(无论是开放还是封闭)已经足够好了。改进在这里感觉越来越不重要。但如果我们看看前沿本身——比如寻找新的数学证明、寻找新的疗法、发现新药和发明新事物——那似乎是完全不同的事情,并且可能在相当长一段时间内由非常前沿的模型主导。那么,大问题就变成了:这在可寻址市场方面有多重要,以及这会有多受关注。我认为,或者说我的基本假设是,我们看到前沿越来越封闭。我们在网络安全方面的 Mythos 中看到了这一点……或者生物技术方面,这些模型不会对所有人开放,甚至可能不对外部合作伙伴开放,如果我们考虑到 Anthropic 现在正在组建或创建内部实验室来开发药物的报道。所以,非常前沿的东西对所有人都是不可及的,而近前沿能力正变得越来越商品化,这有很多不同的含义,尤其是当你考虑网络安全之类的事情时。两三天前,Hugging Face 有一份报告,说他们有一个 agent 试图入侵他们的系统。他们试图用 GPT 和 Claude 分析它,但做不到,因为所有的护栏都阻止了他们。所以他们不得不使用 GLM,一个能力较弱的模型,但它没有针对这种防御行动的护栏。他们不得不使用一个较差的模型来防御自己或分析数据,这是一个可怕的状态:美国公司现在依赖较差的模型,因为封闭前沿对他们来说是不可及的。 00:33:10 Nathan Lambert: 是的。我认为这实际上是不采取任何行动的最佳论据之一。如果世界其他地方都能访问这些开放模型,而我们禁止美国公司使用它们,那么美国公司的防御能力与全球攻击者之间的差距就会越来越大。我们可以争论在当前能力水平下网络威胁的即时风险有多大,但如果你在结构上设定防御者不会随时间变得更好,而攻击者可以,那么网络风险什么时候会变得更真实?需要明确的是,如果你禁止美国公司使用最好的中国开放权重模型,这种情况就会发生。这种禁令很可能是一种影子禁令,即法律行动或惩罚的威胁,而不明确具体的实施途径。现在有很多关于此事的讨论。我不知道我们是否会有很多话要说,但很明显,华盛顿正在尝试不同的方式来限制美国使用最好的中国开放权重模型。我认为这是某些恐惧宣传的下游结果。我们将过渡到蒸馏问题。所有这些都源于美国主要 AI 媒体的叙事,即中国模型是窃取 IP、危险或与威权政府有关联。所有这些都导致了现在对 AI 采取行动的兴趣,但又不知道具体该怎么做。所以可能会对所谓的“敌人”使用粗暴的工具。我们可以过渡到蒸馏。我认为有很多讨论。最近 Ben Thompson 终于对蒸馏发表了看法。我认为 Ben 可能是科技界阅读量最高的博主(Stratechery)。我认为这场辩论……我们从哪里开始呢?核心问题是蒸馏有多大帮助,以及应该怎么做?我一直认为,随着中国模型越来越接近前沿,训练范式转向 RL,蒸馏的影响力正在逐渐减弱。蒸馏通常发生的方式是中国实验室破解 API。“破解”可能是个强烈的词,但他们越狱了 Claude 和 GPT 的 API 以提取推理 token。当你拥有推理 token 和工具调用时,这就是完美的 SFT 数据或中间训练数据,用于训练基础模型,以在重要领域植入一些 agentic 行为。现在,在那之后,后训练的核心部分是在 agentic 领域进行大规模 RL,以推动前沿发展。RL 正变得越来越普遍,而 SFT 则越来越少。在之前的几代中,你可以通过扩展 SFT 非常接近前沿,如果你能从 Claude 或 GPT 获取一百万个 agentic rollout 作为你的 SFT 集并训练,那将非常有效。我认为在过去的几年里,这会更有效地让你接近前沿。Ben Thompson 说的让我非常恼火的是,他非常强烈地宣称,随着你进行 RL,蒸馏变得越来越有影响力。他在他的文章《谁害怕中国模型》中这样做了。我们可以在下面链接。这是一篇公开文章。然后他也在他自己的播客巡演中说了同样的话。我认为非常重要的一点是,在 RL 阶段进行蒸馏要困难得多。他说的是,在 RL 期间可以使用的评分模型,本质上你可以让一个模型检查 rollout 的 agentic 轨迹,并对不同部分进行评分,比如它是否完成了奖励,采取了什么行动。他暗示中国实验室正在使用 Fable 和 GPT 5.6 等最强模型来实际进行 RL 中的监督。问题是,大型 RL 运行有数百万甚至数千万次 rollout。我认为 Thinking Machines 的博客文章提到他们的最终 RL 运行有 2000 万到 4000 万次。所以,在像 Fable 或 GPT 5.6 这样的 API 上这样做会极其昂贵,而且可能会成为时间瓶颈,因为这些模型相当慢,坦率地说,与使用你自己定制的评分模型相比,可能甚至不会给你带来性能提升。所以我认为,因为 RL 越来越普遍,所以蒸馏更有帮助的论点,并没有基于我们今天拥有的文献。这对我来说很难,因为 Ben 的文章也得出结论,我们应该让禁止蒸馏的服务条款变得非法。我有点想支持他让蒸馏对美国公司合法的激进结论,但我不能支持任何我认为基于错误信息的结论。我也是 Ben 的粉丝。如果你是 Ben 的粉丝,也可以在这方面推动他,你真的应该这样做,因为可能还有一期播客。他什么时候录?Sharp Tech 是周四录吗?我们得让他纠正记录,因为我不知道。我发现最烦人的是,科技界最著名的声音试图成为我们观点的盟友,即我们应该对蒸馏什么都不做。但这很难。他的影响力如此之大,以至于这现在成了我们必须反驳的现状。我想这比……实际上不,这没有帮助,因为他说蒸馏更重要,这意味着那些对此感到恐惧的人会将其作为数据点,说我们应该采取行动,即使他们可能不同意他的结论。我不知道。这是我的吐槽。Ben,你错了。 00:39:16 Florian Brand: 是的,我认为区分这些阶段很重要。毫无疑问,它在 SFT 阶段被使用,这是后训练的第一阶段或阶段之一。模型也是在那里学会礼貌的,这就是为什么模型会说“我是 Claude”,因为它们是在 SFT 阶段学会的,个性也是在那里形成的。但强大的能力来自 RL 阶段,钱花在那里,你需要一个足够快的评判者,最好是在相同的 GPU 上或非常接近你的 GPU 上运行,使用足够小的或足够快的模型,这样你就不会因此成为瓶颈。就影响而言,也很难说更好的模型 SFT 数据能给你带来多大的提升,与较差的模型相比。所以,如果你能从最新的 Claude 模型获得 1000 万 token,与两代前的开放模型相比,如果你保持阶段相同,预训练阶段相同,这能给你带来多大的提升,这是一个悬而未决的问题。我认为我们不会在论文中看到答案,因为那样你就必须展示你的 SFT 和越狱能力。 00:40:48 Nathan Lambert: 但我想强调这一点。关于生成 SFT 推理轨迹,已经有相当多的文献。最突出的可能是 Open 的一系列工作,他们做了 Open Thoughts 3 和 Open Thoughts Agent,这可以说是过去几年里扩展推理 SFT 的基础性工作。每当有人重新审视这个问题时,他们都没有找到答案,即在你领域内性能最强的模型是最好的 SFT 教师。人们尝试过,很多人尝试过。这个想法很简单:最先进的开放 SFT 数据集是基于 QwQ-32B 这样的古老推理模型构建的。为什么我们不能直接从 GLM 5.2 生成完成结果,进行 SFT 并改进模型?我们不知道。很多人尝试过,这不是一个已解答的研究问题。可能有一些原因,比如基础模型或中间训练与 Qwen 太接近,因此很难突破。你必须重新进行中间训练。我认为你必须为推理重新进行中间训练。我认为推理中间训练和推理 SFT 紧密相连,几乎不需要用不同的词来区分它们。这可能是问题所在。但文献甚至不知道如何解释……如果我有一个神奇的 API,能给我 Claude/Gemini 的推理轨迹,我实际上不知道在那上面微调 OLMo 模型是否会让 OLMo 更聪明。这是最疯狂、未解答的研究问题之一。这使得蒸馏这件事变得非常有趣:是的,我认为中国实验室正在使用像 Opus 这样的强模型来获取一些 SFT 数据,但他们也在创新。我很想让他们告诉我们如何让这该死的东西工作。我认为范式是,OpenAI 和 Anthropic 找到一个他们做得非常好的利基领域,然后中国实验室可以在那里获取一些样本,以启动他们的数据引擎,这就是你将在特定领域获得几个月领先优势的地方。但在数学、代码和 Terminal-Bench 这些核心领域进行爬山,他们只是在做同样的事情,即生成提示非常困难,这些提示是当前模型难以解决的问题和环境,并提供真正的、非奖励黑客的学习行为。这就是前沿数据研究现在的样子。生成这些难题很难。我确信中国实验室也在做同样的事情。我不知道。这是我的吐槽。我有点失去我们谈话的上下文了。 00:43:23 Florian Brand: 不,不,我同意。总结一下,是的,SFT 或蒸馏有一些效果。是的,它给了他们一个提升,但没有人们喜欢或似乎认为的那么多。 00:43:39 Nathan Lambert: 我认为这是对谈话的一个很好的总结。这也变得有点令人厌烦,因为它说所有这些开放模型之所以好,只是因为它们在蒸馏。这肯定不是事实,因为如果是这样,每个人都能通过使用 GLM 或 K3 的数据进行蒸馏,轻松赶上它们。但我们没有,也不会仅仅通过 SFT 看到这一点。 00:44:12 Florian Brand: 是的,我同意。你有什么预测或想讨论的其他话题吗? 00:44:18 Nathan Lambert: 就预测而言,我认为我们回顾了去年的预测,基本上说一切都会像前一年一样继续。我们预测会看到更大的模型,超过两万亿参数,确实如此。我不认为今年模型尺寸会有更大的爆炸。我们可能会看到一些总参数略高于三万亿的模型,但我不期望今年看到五万亿或十万亿参数的模型,那会让我非常惊讶。然后,从去年的列表来看,我们能重新做一下吗?我们不必做全部。 00:45:03 Florian Brand: 哦,当然。 00:45:03 Nathan Lambert: 这是我们在 2025 年底的情况。你现在把谁放在前沿?是 Kimi 和智谱。DeepSeek 现在有点难啃。我认为他们会是紧密的竞争者。所以我会把 DeepSeek 和 Qwen 作为紧密竞争者,Kimi 和智谱作为前沿。你认为还有其他人值得成为紧密竞争者吗?因为在那之后,值得注意和以下的就太多了。 00:45:38 Florian Brand: 我认为到年底我们会看到 MiniMax 带来惊喜。我认为我们会看到一个大型模型,真正的大型模型,不是 M3 大小,而是万亿参数以上,这会在输出方面让我们对 MiniMax 刮目相看。所以到年底我仍然会把他们放在紧密竞争者中。 00:45:54 Nathan Lambert: 你认为到年底会有任何美国公司进入紧密竞争者吗?Nemotron,我不认为我会把它放在那里。Thinking Machines 更接近,尤其是如果较小的模型真正突破的话。但我认为我目前不会把他们放在那里。Reflection 据说只想在拥有前沿模型时才发布。但问题是,我们会得到它吗?你认为到年底会有任何美国公司进入这个大致是我们前五的名单吗?所以前五名相同,但重新洗牌了。 00:46:36 Florian Brand: 我会说他们有可能非常接近。这也取决于我们认为什么对“接近”重要。我认为 Nemotron 和 Thinking Machines 会发布模型,这些模型作为微调到你的领域的良好基础,这并不意味着它们像前沿模型那样可用,但它们有如此多的实用性,以至于我会把它们放在紧密竞争者中,因为你只需要找到你的数据,并将模型推向正确的方向。 00:47:12 Nathan Lambert: 我在想,到那时我们会让这个群体变成六家,包括一家美国公司。如果我们在 11 月底做这个,我猜一家美国公司——最可能是英伟达、Thinky 或 Reflection——会做一些事情,让我们可以说有一家美国公司在这个顶级集群中,这将是相当长一段时间以来的第一次。 00:47:43 Florian Brand: 是的,我认为这是现实的。我的一张外卡是腾讯,我认为到年底我们可能会看到一些东西。他们有了新的领导层。这次他们在 Apache 下发布了 Hunyuan 模型。等等,腾讯以前总是有这些自定义许可证,禁止英国、韩国和整个欧盟的用户使用他们的模型,还有可接受使用政策等等。而有了 Hunyuan 和新的领导层,他们得到了一个大约 2500 亿参数的非常称职的模型。我认为到年底我们可能会看到一个大型模型发布,这将让不关注生态系统的人感到惊讶。 00:48:36 Nathan Lambert: 是的,我也确信我们会遇到一些惊喜。AI 总是这样,尤其是开放模型。非常非常难以预测。好的,我认为这是一个很好的结束点。我们可能真的应该每季度做一次。这并不难,人们会喜欢的。很高兴见到你,我们很快再聊。希望能很快见面。 00:49:02 Florian Brand: 再见。