Interconnects · Nathan Lambert

教每个人学会获取Token

Teaching Everyone to Fish for Tokens

二〇二六年八月十八日 · 英文原文

本文讨论了开放语言模型生态系统的现状与未来。当前开放模型发展常被类比于Linux,但开源配方(含训练数据、代码)与开放权重模型(仅权重和推理代码)存在差异。Ai2的Olmo、EleutherAI的Pythia等代表开源配方,Nvidia投入260亿美元支持近乎开源的Nemotron模型,旨在创造大量推理需求。未来可能分叉:一是开源模型通过性能或AI繁荣实现经济自持,二是转向效率、专业化等长尾应用。Meta发布Muse Spark 1.2开放权重模型,削弱Anthropic和OpenAI的API收入。

家务说明:本篇没有配音,因为我在旅途中。人们最常做的比较,是当前开放模型的发展与Linux操作系统等基础开源软件项目之间的类比。这些类比相当清晰,但它们为开源模型生态系统的自我维持特性描绘了一条狭窄的前进道路——在Linux足够壮大后,它自然成为许多任务的最佳工具。开源语言模型——即只有附带完整训练配方、数据、代码等的模型——更接近开源操作系统。你使用的开放权重模型——那些仅包含模型权重和推理代码的——更接近你在基于它们构建的项目中安装的特定软件版本。分享模型权重平均而言非常短暂,但它们仍有很长的保质期,就像许多被广泛使用的软件一样。这就是为什么许多公司仍在使用基于Llama 3构建的工作流,尽管智能体行为在几年后才兴起。开源配方,现代典型代表是我在Ai2帮助构建的Olmo模型,其前身包括EleutherAI的Pythia,是一个资源密集型过程,任何公司都可以拿起、修改并按下“运行”来生成一组新的模型权重。在最佳情况下,社区还可以将数据或训练代码的改进贡献回下一个模型!这就是为什么Nvidia在近乎开源的模型上投入如此之多——对于他们的Nemotron模型,他们发布了所有法律允许的数据和训练代码等。Nvidia希望创造一个无数人能构建token机器的世界,这样智能就不会被垄断。这是一个对推理需求巨大的世界,许多公司都想购买Nvidia的产品。开源AI的未来充满挑战,因为构建最佳模型极其资本密集。在行业中,构建竞争性模型的能力比许多人预期的更长时间保持可及性。许多人的默认预期是训练模型太昂贵,开源配方落后太多,因此围绕LLM训练的某些部分建立新实验室将不可行。从这里有两个未来。第一种是如果“它有效”——如果开源配方对Nvidia有效,他们将创造远超构建模型成本的对芯片的需求(和利润)。目前据报道,Nvidia在这项努力上花费了260亿美元。目前尚不清楚这是否会成功,或者AI的资本密集性是否会驱使越来越多的公司退出训练游戏。我们还没有看到太多迹象表明这开始发生。事实上,退出的公司——如Databricks和01.ai——似乎是异常情况。开源生态系统在未来几年将越来越依赖Nvidia的资助。这是一个生存窗口,在几年内,这种方法的利润需要回报给他们,或者另一家开放模型公司需要在其开放性上培养类似平台的财务反馈循环。这种经济回报需要与Anthropic和OpenAI的API产生的利润成比例,以在数十年的语言模型开发中保持步伐。这可以通过性能竞争力或AI繁荣如此之大以至于开放模型训练、推理和微调公司都有大量需求来驱动。第二种未来是如果这两条财务积极路径之一未能实现,开放模型将分叉到与领先封闭模型不同的发展路径——一条更注重效率、可修改性、专业化等的路径。我在心理上将其视为最可能的结果——开放模型仍然非常有用,但相对于在知识工作协作、药物发现、SWE等最有价值领域拥有垄断所有权的封闭对应物,它们填补的是长尾生态系统。长尾类似于企业特定智能体,它们在本地运行,使用私有数据处理重复性业务任务。我认为开源训练难以流行的一部分原因是训练变得越来越复杂和抽象。当前开放模型生态系统受到对后训练开放模型兴趣激增的推动。这些人拿DeepSeek V4 Flash、Inkling Small或GLM 5.X等模型,并为他们的特定智能体任务进行微调(例如,在Tinker中,这是目前最流行的微调API)。Interconnects AI是一个读者支持的出版物。考虑成为订阅者。在过去几年里,后训练主要指修改基础模型使其智能和可用的整个过程。现在正在发生一种转变,训练基础模型成为通用智能体推理器的能力正变得不透明,就像几年前的大规模预训练实践一样。这可能会走得很远,甚至改变已确立几年的预训练、中训练、后训练词汇。它可能变得更接近预训练、推理训练和后训练。随着对训练整个模型的兴趣减少,对投资开源AI的兴趣也在减少。这些是我们能得到的唯一提示,但我们无法对抗这些情况的经济引力。这一趋势是发布基础模型(核心推理训练前的模型版本)的开放模型构建者数量继续减少的下一步。它与开放模型构建者尝试对下游产品或推理使用采用收入分成许可的实验相辅相成。这些实验是为了保持构建接近前沿开放权重模型的融资可行性——近期很多事情取决于它们的成功程度。这些人是Nvidia围绕开源的需求增长策略成功并持久所需的关键。一路上,我们仍将看到开放权重模型的大量动作,因为发布智能访问权是可用的最强商业策略之一。这种额外类型的参与者,间接通过AI变现,以Meta和其他拥有庞大资产负债表的超大规模企业为代表。Meta发布其非常强大的Muse Spark 1.2模型作为开放权重,将严重削弱其依赖出售token的竞争对手Anthropic和OpenAI的收入增长率。这些公司都在将互补品商品化,但方式不同。Nvidia想教会每个人钓鱼token,使生态系统自我维持,而Meta则在战略性地用token淹没区域。

译自 Interconnects · Nathan Lambert · 录于 二〇二六年八月十八日