Dwarkesh Podcast

持续学习时代的8个预测

8 Predictions for the Era of Continual Learning

二〇二六年八月七日 收听原版播客

该内容讨论了AI真正持续学习的必要性及其影响。作者以萨克斯学习类比,说明仅靠会话间传递笔记无法积累技能,需将经验内化。持续学习将改变AI监管模式,从部署前检查转向月度或季度风险评估;改变对齐研究,需关注权重持续更新下的安全性;增加AI思维多样性;加速领先者回报;促使实验室尽早部署模型;为实验室创造商业模式,通过切换成本形成锁定;并带来推理规模经济,偏向大型组织。

A

我在其他地方已经解释过为何我认为真正的持续学习是必要的。我不认为,如果AI被迫每次会话只能写Markdown文件,它们就能像人类一样胜任完整的工作。举个形象的例子,想象一下如果这是学生学习萨克斯的方式。有一个学生,他从未吹过萨克斯。他走进音乐厅,尝试吹奏。当然,因为是第一次,他失败了。他写下了一堆关于哪里出错的笔记。下一个学生在音乐厅外等候,他进来,读了所有这些笔记。他也从未吹过,所以当然也搞砸了,并继续在笔记上添加内容。外面有无限多的学生,他们不断给下一个人写笔记。我不认为他们之间能写出任何文本序列,能让后续学生第一次尝试就完美吹奏萨克斯。在某个时刻,你实际上必须将相关经验积累到你的大脑中。我认为,对于我们希望AI从它们部署的各种工作场所中积累的许多技能,情况也会如此。那么,一旦我们有了真正的持续学习,会发生什么变化?第一,我认为许多关于AI监管的提议都假设你先训练模型,然后部署它。因此,如果你在部署前对模型进行一系列检查,就能确保它不会协助网络攻击或做出疯狂的事情。我不认为这个假设在未来必然成立。这也是我目前对锁定某种安全监管体制感到担忧的众多原因之一,因为我们不知道未来一年内会面对什么样的技术,更不用说五年或十年了。如果模型每天都在根据当天数百万次会话的工作而改进呢?如果发生这种情况,我们可能正在锁定一种过时且可能适得其反的方法来应对AI带来的威胁。如果政府希望对模型提供商进行某种安全评估,我认为更合理的做法是进行月度或季度风险检查,而不是试图挑出训练完成后、部署开始前的某个特殊时刻,因为这在未来将不再是一个有意义的独立类别。第二,实验室如何进行技术对齐可能需要彻底改变。目前,许多研究集中在如何确保一组冻结的权重在部署期间表现良好。但我不知道有多少研究关注如何确保即使权重持续更新,AI系统也不会被越狱或变成欺骗性或邪恶的人格。如果AI还在用户之间整合学习,我们如何防止用户向基础模型注入后门或某种恶意倾向?从某种意义上说,这实际上就是人类对齐问题,对吧?人类以自我导向的方式改进。如果你有孩子——我没有孩子,但我想象是这样——如果你有孩子,他们出去学习新东西,有时会发疯。他们被疯狂意识形态一击即中。他们吃错药。他们变得超级奇怪。但你希望你已经给了他们足够的常识和基本价值观,让他们以自我导向的方式成长,而不会最终持有某些超级奇怪的信念或厌世思想。第三,AI思维的多样性将增加。目前,不到五个主要的AI思维,我指的是基础模型,它们同时服务于数百万、数亿或数十亿用户。而且它们彼此都很相似,因为它们也都在大致相同的数据上训练。但如果AI从经验中学习,而这些经验不仅在不同AI公司之间不同,而且在同一AI模型的不同实例之间也不同,我们实际上可能会看到这个世界另一端出现大量多样性。我认为这将是一个净正面的结果。我认为未来需要担心的一个问题是只有一个单调的单一实体,这相当无聊。一个拥有持续学习的世界希望比我们现在看到的模型模式崩溃更有趣。第四,当部署成为训练的一部分时,在AI竞赛中领先的回报会加速。因为如果你拥有最好的模型,更多人使用你的AI进行更复杂和有用的工作,结果他们给了它大量反馈,它能在会话窗口之外整合这些反馈,那么你的模型会变得更聪明。第五,如果模型主要从部署中学习,那么实验室会感到很大压力,需要尽早部署它们最聪明的模型。据报道,Anthropic自2月以来一直在内部使用Mythos,但直到6月才向公众发布。在真正的持续学习机制下,这种事情根本不可能发生。你不能在内部和外部部署之间保持4个月的差距还能保持竞争力,因为一个在发布日发布最差模型的竞争对手,基于真实世界经验,会拥有更聪明的模型。第六,持续学习将为领先的AI实验室创造他们目前缺乏的清晰商业模式。许多人一直在问,AI实验室如何真正赚钱?我也一直在问这个问题。当我在播客中采访Dario时,我问他这个问题,他类比了云提供商,并指出,看,云提供商提供许多无差异化的服务,但尽管如此,它们仍能获得高利润率。如果你看亚马逊或谷歌的季度财报,你会注意到这一点,它们表现很好。但云利润率如此高的原因是,从一个云切换到另一个云非常耗时且昂贵。目前,没有什么能阻止我用Codex启动一个软件仓库,然后用Cursor做更多工作,最后用Claude Code完成。但一旦我们有了真正的持续学习,你使用的模型在与你互动时每次会话都会变得更好,那么实际上会有相当大的切换成本。如果你想更换你使用的AI,你基本上必须解雇一个已经积累了数月关于你组织上下文的员工,然后用一个非常新鲜、非常没有经验的新实习生替换,你必须从头开始重新培训。一旦有了这种锁定,模型提供商就能要求相当高的利润率。有趣的是,这确实强调了新鲜实习生。第七,当然,企业会意识到这种动态。它们会试图避免这种锁定。但如果选择是,要么被模型提供商锁定,要么失去这个超级有价值的功能——你的模型每次会话都为你改进——那怎么办?如果实际使用最终成为模型改进的主要方式,那么AI实验室可能会补贴允许模型在其会话上训练的用户和企业。如果你看编码产品新用户提供的各种优惠,这已经在发生了。这与谷歌免费提供搜索的原因非常相似。相反,实验室可能会说,任何拒绝让他们在会话上训练的企业都不能访问最好的模型。通过Keras和STIX,实验室可以做很多事情来让用户允许AI从经验中学习。当然,我忽略了更新一个用户权重集和将所有不同的权重分支拉回主模型之间的区别。后者可能在技术上更具挑战性,但假以时日,这也会被解决。第八,AI训练已经具有很大的规模经济效应。你可以将所有这些昂贵的训练成本分摊到更多用户身上,证据是实验室收入增长远快于其计算能力。但持续学习也可能在推理方面为最终用户带来规模经济,即通过批处理。你可能看过我和Ryder Pope的那集节目,我们详细讨论了这一点,但如果每个公司的指令需要完整的权重更新,而不是存在于低秩适配器中,那么批处理会有巨大优势。粗略计算表明,像DeepSeq V3这样的稀疏模型的最佳推理批处理大小是同时生成超过2400个并发序列。如果你不这样做,那么你的计算资源就未充分利用。如果你想理解为什么,我再次强烈推荐那集关于推理经济学的节目。但无论如何,这里的重点是,一组给定的权重只有在同时解码数千个序列时才能高效服务。一个拥有大量员工和代理、做各种不同事情的大公司可以高效地服务其权重分支,而一个只运行批处理大小为1的个人用户,其计算效率可能会差两个数量级以上。因此,服务个性化权重的经济学强烈偏向大型组织。显然,到持续学习真正实现时,还会有更多变化。最重要的变化可能是最难提前预见的。但以上这些即使在现在也似乎相当清晰。这是我博客文章的朗读版,也发布在我的网站上。请访问dwarkesh.com查看。否则,我们下期播客再见。

译自 Dwarkesh Podcast · 录于 二〇二六年八月七日