前沿后训练配方回顾:与Finbarr Timbers对话
Frontier post-training recipe review with Finbarr Timbers
Nathan Lambert 与 Finbarr Timbers 在播客中回顾了后训练(post-training)方案的演进,从 InstructGPT 的 SFT → 奖励模型 → RL 三阶段,到 Llama 3、Tülu 3 的 SFT → DPO → RLVR,再到 DeepSeek R1 以大规模 RL 为核心。2026 年前沿模型(如 MiMo Flash V2、DeepSeek V4、Nemotron 3 Ultra)引入多教师在线策略蒸馏(MOPD),训练多个领域专家教师后通过在线策略蒸馏合并为学生模型。Finbarr 刚离开 AI2,讨论了 OLMo 3 的简单方案与前沿工业方案的差距。
在我为 RLHF / 后训练(post-training)一书收尾、回顾后训练基础知识的过程中,我知道必须请 Finbarr Timbers 再次回到播客,聊聊当前的发展态势。过去几个月,我们多次讨论过,要如何将 Olmo 风格的方案推向前沿——这得益于 Finbarr 对近期模型技术报告的广泛阅读。为准备这次对话,我整理了一份总结幻灯片,梳理了历史上关键的后训练方案——从 InstructGPT 到今天的路径——以及当前前沿的开放模型。这份幻灯片的内容总结如下(即技术摘要部分),但我们在播客中花了 20-35 分钟讨论它,因此观看 YouTube 版本可能是最佳体验。我此前在 2024 年 12 月采访过 Finbarr,当时正值 o1 和 Tülu 3 发布后不久(在他加入 Ai2 之前),我们讨论了 RL 的“我们回来了”时代。
章节: 00:00 引言 & Olmo 反思 06:28 后训练方案回顾(历史) 23:00 2026 年的模型方案(MiMo Flash、DeepSeek V4、GLM 5、Kimi K2.6 等) 39:05 开放式后训练讨论 48:22 LLM 竞赛中的职业建议
在 Apple Podcasts、Spotify 以及你收听播客的任何平台收听。其他 Interconnects 访谈请点击此处。更多后训练教学视频,请参见我正在制作的课程。
技术摘要 以下笔记来自一份借助 AI 辅助制作的幻灯片——主要用作讨论主题和参考。过去一年中,后训练方案形态的变化比之前三年加起来还要大。
2022–2023(InstructGPT):一条流水线——SFT → 奖励模型 → RL。 2024(Llama 3、Tülu 3 等):开放方案将 SFT → DPO → 带可验证奖励的 RL(RLVR)形式化。闭源方案使用多阶段 RLHF。 2025(DeepSeek R1):推理 RL(R1)使大规模 RL 成为核心。 2026(MiMo Flash V2):方案碎片化为许多专家模型,再合并回一个模型。
新事物:MOPD 多教师在线策略蒸馏(Multi-teacher On-Policy Distillation,MOPD)是 2026 年前沿模型中出现的模式。 训练 N 个领域专家教师(每个教师:SFT,然后在相关领域上进行 RL)。 训练一个通用学生模型,通过采样其自身的轨迹(这是最终的后训练模型)。 在每次 rollout 中,逐 token 最小化与相关教师输出分布的反向 KL 散度。 谱系:MiMo Flash v2 引入 → DeepSeek V4 和 Nemotron 3 Ultra 将其扩展到 10 个以上教师。
为什么 MOPD 会出现? RL 变得昂贵且容易冲突。在一次运行中混合数学、代码和 agentic RL 最终会导致能力相互抵消。 专家模型制作成本低 / 组织上可扩展。在单一领域上进行 SFT 然后 RL 是成熟且可并行的。 随着后训练变得更加复杂,跨组织扩展它是一个巨大的优势。 在线策略蒸馏技术成熟。相关文献和知识通过 RLVR 复兴不断涌现。
来源:DeepSeek V4 §5.1、MiMo-V2-Flash
历史上的关键方案 InstructGPT(2022 年 3 月)——经典的 3 步 · 论文 在人类演示上进行 SFT 在人类比较上训练奖励模型 针对奖励模型进行 PPO
Llama 2(2023 年 7 月)——多阶段 RLHF · 论文 · Interconnects 回顾 SFT,然后多轮迭代 RLHF 每轮:拒绝采样 → PPO 两个奖励模型——分别处理 helpfulness 和 safety
Llama 3(2024 年 7 月)——使用更简单优化器的复杂多阶段方案 · 论文 · Interconnects 回顾 每轮:奖励模型 → 每个 prompt 采样 K 个 → 拒绝采样 → SFT → DPO 无在线 RL——RM 仅用于过滤;运行 6 轮,最佳模型作为下一轮的种子
Tülu 3(2024 年 11 月)——简单的三阶段后训练 · 论文 · Interconnects 回顾 精选 prompts → SFT → DPO → RLVR(带可验证奖励的 RL——该缩写由本文提出)
OLMo 3(2025 年 12 月)——对 Tülu 3 方案的推理更新 · 论文 · Interconnects 回顾
DeepSeek R1(2025 年 1 月)——RL 作为核心 · 论文 · Interconnects 回顾 方案:R1-Zero——在基座模型上纯 RL(GRPO),无 SFT;用于为完整运行播种推理行为,非独立产品 R1——冷启动 SFT → 推理 RL → 拒绝采样 SFT → 最终 RL → 蒸馏到密集模型 方案的重大变化:大规模 RLVR 作为主要驱动力,SFT 用于蒸馏和精炼 RL 行为
DeepSeek 在 V3 之后的演进 V3 · 2024 年 12 月——SFT + GRPO RL。 R1 · 2025 年 1 月——多阶段 RL;推理涌现。 V3.1 · 2025 年 8 月——在单一模型中混合思考/非思考模式。 V3.2 · 2025 年 12 月——通过 RL 训练 6 个专家 → SFT 蒸馏 → 一次混合 GRPO。 V4 · 2026 年 4 月——10+ 领域专家 → MOPD。
2026 年风格的方案! MiMo Flash v2(2026 年 1 月)——MOPD 的起点 · 论文 阶段:阶段 1 SFT → 阶段 2 训练约 6 个领域专家教师(使用较旧风格的后训练方案)→ 阶段 3 MOPD 合并到单个学生。 首次清晰阐述多教师在线策略蒸馏作为整合步骤——用“从专家蒸馏”取代单一的整体 RL 阶段。
Nemotron 3 Ultra(2026 年 6 月)——两轮,多个教师 · 论文 阶段:SFT → 多教师在线策略蒸馏,运行两轮迭代,使用超过 10 个教师,涵盖推理、代码、数学和 agentic 领域。 新颖之处:跨不同领域的多轮 MOPD——蒸馏,然后从刷新后的教师再次蒸馏。
MAI-Thinking-1(2026 年 6 月)——更接近 R1 而非 V4 · 公告 阶段:中期训练基座 → 3 个专家 RL“攀登”(例如 STEM)→ 轨迹蒸馏 SFT 以整合攀登 → 最终 RL 攀登 → MAI-Thinking-1。 更接近 DeepSeek R1 而非 V4——多阶段 RL,使用轨迹蒸馏 SFT 进行整合,而非在线策略 MOPD。并非唯一不使用 MOPD 的实验室!
Kimi K2.5(2026 年 1 月)——agentic、多模态 · 论文 · 博客 阶段:纯文本 SFT → 联合文本-视觉 RL,涵盖编码、视觉、推理、agentic 任务。(未提及 MOPD。)
GLM-5(2026 年 2 月)——按能力分阶段 RL · 论文 阶段:基座 → SFT → 推理 RL → Agentic RL → 通用 RL。
文字记录 00:00:00 Nathan Lambert:大家好,欢迎回到 Interconnects 对话。我不太说自己做采访。人们批评我,因为我太爱打断嘉宾了。我不是个好采访者,但我在这里是为了娱乐大家。嗯,这对我来说也很有趣,因为我正在尝试制作一个后训练课程,这正好算是这个课程的高级部分。所以这算是 Interconnects 内容和今年夏天我花时间做的其他事情的一个交叉。很高兴再次欢迎 Finbarr。我想……你是第一个返场嘉宾吗?我没查过。
00:00:37 Finbarr Timbers:哦,哇。
00:00:37 Nathan Lambert:嗯,Finbarr 和我在 AI2 一起研究这类后训练方案有一段时间了。嗯,我最近离开了。今天是 Finbarr 在 AI2 的最后一天之一。这已经宣布了,不算剧透。所以我们打算回顾一下为 OLMO 构建后训练方案的一些事情。嗯,然后我们有一个小小的回顾幻灯片和笔记,关于前沿后训练方案随时间演变的状态和演进,这很有趣,因为大概有两到四种经典方案。所以当你看到这个领域在某个新事物上趋同时,这很有趣,就像现在正在发生的多教师在线策略蒸馏。不知为何,这有点拗口。这是个很长的缩写。然后我们会以各种关于后训练的讨论点以及我们正在做的事情来结束。所以,如果你有什么热辣观点想先抛出来吸引听众,请随意。否则,我想,嗯,我很期待回顾这个,因为我知道你最近读了很多论文,为这个做了些准备,打了一些基础。
00:01:43 Finbarr Timbers:嗯,是的。我是说,今天是我在 AI2 的最后一天,所以这感觉非常合适,能和你聊聊,因为是你招募我加入 AI2 的。所以,嗯,是的,这很特别,也很高兴成为第一个返场嘉宾。我感到很荣幸能回来。所以,是的,谢谢你邀请我。
00:02:03 Nathan Lambert:是的。我们要从 OLMO 开始吗?我想……
00:02:05 Finbarr Timbers:当然。
00:02:06 Nathan Lambert:……人们……我想我需要小心地说,但我已经多次向人们提到过 OLMO-3 的后训练。我没有在播客上非常直接地做过这个,但我想说,为这个推理模型进行后训练 OLMO-3 对许多个人来说是一个重大成就。但同时,我们所做工作的复杂性正在挑战 AI2 组织能力的极限,而很多现代后训练就是,你如何将计算和数据整合到一个工作流中。为了以复杂的方式做到这一点,你实际上是在整合一个组织架构图。这就是为什么 OLMO-3 本质上作为一个推理模型相当晚的原因之一。它是一个相当僵化的推理模型,这在一定程度上反映在方案相当简单上。但当你把它与所有这些使用工具和多教师蒸馏的新方案比较时,这就像是一个岔路口,你可以做这个非常简单的事情并得到一个强大的方案,但这并不代表所有前沿实验室的做法。我认为这种能够说事情相似的分叉点发生在 Tülu-3 之后,Tülu-3 我认为也简单得多,采用了这种三阶段 SFT-DPO-RL 方案。但那个更简单的方案可能在结果上更接近实验室所做的,但现在为推理模型,尤其是工具使用、agent 模型做那种三阶段方案,就根本不适用了。这就是关键点。这就是为什么我认为这期播客的重点是,他们到底在做什么来制造这些真正的前沿模型,然后揭示这与更开放的学术模型有何不同。
00:03:56 Finbarr Timbers:嗯,实际上,我觉得那很有趣。过程是怎样的?你知道,我只参与了 OLMO-3。我没有参与更早的版本。从 Tülu-3 到 OLMO-2 的过程是怎样的?因为,只是看 arXiv,我想 Tülu-3 是在 2024 年 11 月发布的,然后 OLMO-2 是在 2024 年 12 月发布的。
00:04:22 Nathan Lambert:我们只是应用了那个方案。
00:04:24 Finbarr Timbers:是的。我是说,所以我认为实际上,是的,然后,你知道,DeepSeek-R1 在 2025 年 1 月底发布,而 OLMO-3 是在 2025 年 10 月发布的。是 10 月还是 11 月?我想……
00:04:39 Nathan Lambert:我想是 11 月。
00:04:41 Finbarr Timbers:是的,11 月。对,是 11 月。所以……
00:04:43 Nathan Lambert:那真是感恩节前的背水一战。
00:04:45 Finbarr Timbers:我记得。嗯,是的,因为加拿大感恩节已经过了……
00:04:50 Nathan Lambert:是的。
00:04:50 Finbarr Timbers:……嗯,我很高兴。但是,嗯,我认为,当然,可能有点晚,但只晚了几个月。实际上,考虑到我过去对模型周转时间的经验,从 R1 发布算起,九个月的模型周转时间,实际上并不差。我想,六个月会更好,但是……
00:05:12 Nathan Lambert:我认为它慢是因为我们没有……如果我们重建了 R1 方案,那会很快。但我们做的是,我们把推理移植到了我们现有的方案中……
00:05:21 Finbarr Timbers:是的。好的。
00:05:22 Nathan Lambert:……这是一个更简单的任务,但我认为天花板更低。像 DeepSeek 和更新风格的方案,我们稍后会谈到,我认为它们在你能持续爬坡的程度上天花板高得多。或者它们只是更……更符合前沿的做法。对于 OLMO 那样的模型规模,大约是 7 到 30B,我不确定做这种 DeepSeek 风格的先 RL 方案是否真的有用。
00:05:52 Finbarr Timbers:嗯,是的,这是个好观点。我认为这确实反映在研究中,你看到了巨大的阶跃变化,你知道事情改善得有多快,当 R1 出来的时候。所以,我认为这是个很好的观点,而且它似乎确实会饱和,或者说不会饱和,抱歉,随着计算量的增加。
00:06:11 Nathan Lambert:是的。嗯,我们直接看幻灯片吧?我们一直在抛方案名称……
00:06:15 Finbarr Timbers:当然。我们开始吧。
00:06:16 Nathan Lambert:……我觉得直接看可能有用,因为很多人可能想跟上但不太清楚。我要共享屏幕。所以听播客的人,可能有用的是,你可以在手机上打开这个幻灯片并点击浏览。信息密度不是特别高,但你也可以在 YouTube 上观看。所有这些都会链接。总的来说,这只是一个关于前沿方案如何演变的快速调查。我们会快速过一遍历史,然后讨论当前正在发生的事情,并可能穿插我们之前关于旧模式的讨论。嗯,好的。我们会讨论一系列经典方案。这就是我得到两到四个数字的地方。我认为方案包括 InstructGPT,它开创了最初的 RLHF,提出了这种三阶段想法,人们花了一段时间才从中走出来,即 SFT、奖励模型和 RL。我认为 Llama 3 和 2.3 是这种方案的实际实现,并加入了一些行业技巧。所以这两个可能可以合并在一起。这就像是 ChatGPT 前后的时刻。然后我们将涵盖的两个最新的经典方案,我认为是 DeepSeek-R1,它转向了以推理为中心和更大的 RL 阶段,而不是之前那种以 SFT 为中心,以及 NeMo Flash 和一些 2026 年的新模型,它们增加了这个蒸馏元素。
00:07:42 Finbarr Timbers:嗯,我认为也值得指出,不仅仅是 NeMo Flash,这是一个一致的主题。你在 DeepSeek 那里也看到了,他们在 V3 论文中提到了它,然后,你知道,Qwen K2.5、GLM 5 都是这样。所有这些论文都开始谈论这个专家 RL 阶段。
00:08:03 Nathan Lambert:是的。我认为关于如何划分以及蒸馏是否……如果你把蒸馏作为一种技术、一个关键里程碑,那么小米是第一个,但这是一个随时间推移的进程,你会看到它们变化,我们会逐一过一遍。我不需要打断。
00:08:23 Finbarr Timbers:当你提到蒸馏时,我认为区分直接蒸馏领先的闭源模型和蒸馏这些领域特定模型是很重要的。我怀疑中国实验室两者都在做。
00:08:41 Nathan Lambert:是的。
00:08:41 Finbarr Timbers:但是,他们做的很多事情是训练这些领域特定模型,比如数学模型、编码模型、逻辑模型等等,然后将这些模型蒸馏回来,而不仅仅是蒸馏……所以当我们谈论蒸馏时,它不仅仅是蒸馏领先的闭源模型。
00:09:01 Nathan Lambert:是的。这是个麻烦。我同意。蒸馏这个术语被严重滥用了。嗯,有一张回顾幻灯片。我们需要回顾多教师在线策略蒸馏吗?可能太复杂了,不需要专门做。我们可以稍后再回来看。我想我有点想直接过一遍实际的模型,然后根据需要再使用辅助幻灯片。嗯,这个著名的 InstructGPT 三步法,我想很多人都听说过,但这就是 ChatGPT 出现时后训练的内容,所以它是重要的基础,包括人类监督的 SFT 数据,主要是人类监督的偏好排名来制作奖励模型,然后在其上进行 RL,模型变得更好。有趣的是,所有这些都在某种程度上被淘汰了,至少就我们所知,我们不再使用那么多人类演示数据进行 SFT。可能仍然有一些人类偏好数据在循环中,但我猜测合成数据的作用大得多,而且有奖励模型,但它们不再是关键的 RL 目标了。所以在四年内,几乎所有经典部分都被取代了。这种演变就在其中。我认为 InstructGPT 之后的早期模型,比如 Llama 2,甚至 Llama 3,都非常相似,都是开始用不同的工具分解这个方案,比如拒绝采样、DPO、增加迭代次数。我认为增加迭代次数只是因为更有动力从模型中榨取更多,他们只是把事情分解得更细,而 InstructGPT 看起来更像是一个开放性的研究,这种简洁性是可以接受的。所以……
00:10:48 Finbarr Timbers:嗯,我认为这很有趣,特别是关于一切规模化的程度,对吧?因为,你知道,InstructGPT 是在 ChatGPT 发布之前,所以,它是一件一个小团队甚至单个团队就能完成的事情。但当你开始看 Llama 3 时,它开始变成一个更复杂的过程,你开始有更多专门的数据,有更多空间来投入规模、资金和复杂性。
00:11:25 Nathan Lambert:是的。就像,嗯,无论是营利还是非营利的后训练努力,都想让我给他们建议,而我说,“我真的不知道如何给你建议,除非我每周花二十个小时来理解你方案的细节,”因为,嗯,我无法在不理解模型和后训练过程所有复杂性的情况下,给你一句“做 X”的建议。这使得从透明度的角度来看很困难。即使它完全详细,肯定仍然难以修改和研究。
00:12:00 Finbarr Timbers:绝对。
00:12:02 Nathan Lambert:所以对于 AI2 的 Tülu 2 到 3,很多工作是我们试图超越 Llama 3 后训练的结果,这非常复杂,但我们没有能力将组织扩展到那么远。所以我认为,这是实际工作流程简单得多的一个重要原因,我们有三个清晰的阶段,做着略有不同的事情,并且相互构建。这……在这些论文中从未非常明确地说明组织架构图如何影响方案,但我认为,至少在完全开放的工作和从工业界获得的半开放工作之间的差异中,这是一个非常强烈的信号。
00:12:43 Finbarr Timbers:是的,绝对。而且我认为,特别是当我们看到领域特定模型时,这一点非常清楚,就像你可以很容易地扩展你的组织架构图来……
00:12:54 Nathan Lambert:是的。
00:12:54 Finbarr Timbers:……构建它。
00:12:56 Nathan Lambert:是的。我在 Tülu 2 到 3 的幻灯片之后加入了 Olmo 3,主要是为了展示方案与 Tülu 2 到 3 非常相似,而且组织架构图没有真正改变。我们没有更多的扩展能力,而且模型类型之间,比如思考模型和指令模型之间,有一点分离。但没有重大的重新发明——比如重大的组织变革——它就只是卡在这里,尽力而为。
00:13:22 Finbarr Timbers:是的。绝对。
00:13:23 Nathan Lambert:因为真正的重大变化是 DeepSeek-R1。我以前从未见过这个图,但他们有这个图,也许是为论文的 Nature 版本添加的,他们展示了他们的方案,他们拿基座模型,做 RL zero,然后从 RL zero 中采样来过滤 prompts,然后将其用作 SFT。这就像经历这个过程。他们将其用作下一个版本模型的 SFT,以创建一个内部开发的 DeepSeek-R1,然后他们进行这种重复采样来训练多个 RL 版本,并在某种程度上蒸馏,在蒸馏的意义上澄清和精炼模型的推理行为,然后再进入最终流水线,这又是推理和非推理 SFT 的混合,进入一个更大的 RL 运行。而且……
00:14:11 Finbarr Timbers:嗯,我认为这真的很有趣,因为它开始展示,首先,这里的复杂性。我们开始使用合成数据作为主要输入,但这不仅仅是,你知道,它试图引出特定行为,这是一种工业过程,而不是一个优雅的研究方案。它更像是,我们训练一个模型,然后尽可能好地使用它,并不断迭代。嗯,但我认为另一个有趣的点是,我们开始看到 SFT 作为冷启动。首先,我认为以前 SFT 更像是一个普遍有用的阶段,而在这里,它的主要目的是作为 RL 的冷启动。然后另一个有趣的点是,DPO 从领先方案中开始消失。我的意思是,Olmo 3 仍然使用它,但基本上其他所有人都放弃了它,只是将偏好包含在 RL 阶段的奖励部分中,作为奖励模型或某种方式。所以这是一个非常有趣的变化,后训练中的监督部分被大大降低了优先级。
00:15:27 Nathan Lambert:是的。所以我对这些模型放弃 DPO 的假设是,当你做一个更干净的方案时,本质上需求就消失了。而如果你看 Olmo,它通过在其上精炼模型来获取大量潜在收益,这些输出来自强大的开放权重模型,主要是 Qwen 和 DeepSeek,作为 Olmo 3 的 SFT 训练数据。嗯,那个 SFT 数据和基座模型之间的差异在概率分布上仍然相当大。所以 DPO 有助于进一步精炼和清理那个分布,这种方式有非常粗糙的边缘。但当你有一个更精炼的、工业化的后训练过程时,那个潜在收益将更难获得。有趣的是,我没有完全确认这一点,例如,NVIDIA 以前也使用 DPO 来训练他们较小的 Nemotron 模型。我猜 Nemotron Ultra 可能不会。这是因为他们在开发树上走得更远,使用了这些更在线的方法来创建 SFT 数据。我猜他们的模型会变得在分布外更鲁棒,并且因此有更少的奇怪粗糙边缘。所以这大致是我对 DPO 的假设,使用 DPO 的人可能会被看不起。但如果你试图从零开始启动一个方案并尽可能获取收益,我仍然认为从计算效率的角度来看,它对很多人有效。
00:17:05 Finbarr Timbers:是的。我是说,我认为总的来说,偏好调优有一些有趣的地方,也许它没有得到应有的尊重。因为 Nemotron 3 Super 论文中一个有趣的点是,他们在 RL 中做了一个传统的 RLHF 阶段,这也在时尚和发展中失宠了,但他们看到了相当巨大的收益。所以我认为这些变化中的一些更多是由时尚驱动的,而不是完全严格的消融实验。
00:17:41 Nathan Lambert:对我来说非常值得注意的是,偏好损失函数能为这些模型做这么多事情。模型在那里有巨大的潜力,它只是一个对比损失,基于相当细粒度的反馈。它们学到了各种各样的东西。它们会在数学和代码上变得更好,或者它们的推理策略会被精炼。所以,我……这对我来说很了不起。我认为仍然会有有趣的研究,关于使用基于偏好的损失函数与可验证输出。我认为所有这些都会有效。像 DPO 与可验证奖励之类的东西,只是在智力上不那么吸引人。
00:18:19 Finbarr Timbers:是的。嗯,我认为这就是我认为 Delta 学习假设风格的 DPO,就像 Olmo-3 做的那样,你通过让同一家族的大模型和小模型来创建这些合成偏好,你从中获得偏好。我认为这是一个非常有趣的信号,因为它似乎与我们在扩散模型中看到的一些工作非常相似,比如无分类器引导,有类似的东西,并且那里有非常相似的结果,表明你可以有……但他们使用的一个信号是训练后期与训练早期的模型,作为可以引导的信号来源。而且效果很好。所以我怀疑这些信号,对于这种方式的偏好,实际上可能更鲁棒,但因为一些最大的实验室不必这样做,也许我们没有那么频繁地引用它们。
00:19:18 Nathan Lambert:是的。或者他们没有告诉我们。为了继续这个,看看 DeepSeek 模型经历的这个过程很有趣,我称之为从更接近 Llama 方案到 DeepSeek-R1,这最明确地是推理模型的经典方案,然后继续变化,更接近这种多教师格式。所以如果你看 V3.3 论文,嗯,在 R1 之前,他们做的事情与 Tülu 2 到 3 类型非常相似,他们混合了 SFT,然后使用了可验证奖励的 RL。他们当时没有这么称呼,或者他们的论文当时还没出来。所以他们在 R1 发布之前就做了这个,这只是一个不那么以推理为中心的模型,使用了相同的工具,但实现权重比例不同。
00:20:07 Finbarr Timbers:有趣的是,这基本上与 Tülu 2 到 3 同时出现,而且是一个非常相似的 Tülu 2 到 3 和 Olmo-2。这是一个非常相似的方案,只是用更多的计算完成。
00:20:16 Nathan Lambert:是的。是的。然后我们有这个 R1,我们刚刚在 1 月份详细讨论过,那是一个月后。他们之后又有一些发布。他们对 V3 和 R1 模型有一些更新,有日期,基本上是一样的方案。然后下一个有记录的方案变化是 V3.1,那时他们将思考和非思考合并到一个模型中,每个这样做的人都说训练起来是地狱。但从服务角度来看你需要它,而且很明显,长期来看,至少对我来说很明显,所有模型都将是推理模型,你只会拥有非常高效的推理模型,基于那里的收益。所以这是他们做出的一个必要改变。然后在 2025 年 12 月,他们发布了 V3.2,那时他们的方案有了有意义的改变,他们谈论了使用单独的小方案创建专家,然后将其用于他们的 R1 数据处理流程中,以生成 SFT 数据,然后最后用 GRPO 进行一次大的 RL 运行。所以这种 R1 风格方案的演变花了大约一年时间才落地到他们的模型中。我认为这是一个非常大的复杂性步骤,在 Olmo-3 这样的东西中没有体现,你可以看到方案随时间推移的分叉,因为它们在这些前沿实验室中变得更具工业化和规模化。
00:21:46 Finbarr Timbers:是的。我认为,从历史记录来看,另一件好事是,我认为是在 O3-24 发布时,他们更新了原始的 V3 论文。所以,V3 在 R1 之前发布,然后 R1 发布,然后在 R1 发布之后,他们实际上回去更新了 V3 论文,也许是为 Nature 投稿做准备或类似的事情。
00:22:07 Nathan Lambert:是的。
00:22:07 Finbarr Timbers:嗯,他们在那里做了一个引用,说,“哦,你可以做的是训练这些领域专家模型,然后组合它们。”嗯,然后,后来这成为了他们在 V3.2 中讨论的更高优先级的事情。
00:22:21 Nathan Lambert:这是个有趣的注记。是的。然后最近在 2026 年 4 月是 V4 模型,它有更多的专家。他们添加了这个新的损失函数用于多教师在线策略蒸馏,我称之为 Jiaoli。这有点像整个行业所经历弧线的缩影,至少是那些分享后训练细节的人,他们意识到 RL 的核心地位,围绕规模化 RL 改变方案,然后找出如何在规模化 RL 格式下扩展到更多领域,而不会在操作复杂性上陷入停滞。
00:22:58 Finbarr Timbers:是的。
00:23:00 Nathan Lambert:所以接下来是这些我称之为 2026 年风格的方案,都是这些在做多教师知识注入的模型。然后其中一些使用在线策略蒸馏,一些不使用。关键要看的是,这种在线策略蒸馏对于保持前沿地位有多关键。所以命名这个术语的论文是 MimoFlash V2 论文。我认为模型是在 12 月发布的,论文在 1 月,很多东西看起来会类似,嗯,这种 RL、大规模 RL 风格的方案。但在这个大规模 RL 运行中,更多的是在线策略蒸馏发挥作用的地方。所以,我认为现在是解释的好时机。我有一个很棒的小功能。这是多教师在线策略蒸馏的总结。通常,它适合 RL 框架,你有一个正在训练的模型,通用模型,采样它自己的轨迹,然后你将轨迹路由到你训练过的各种专家模型。每种样本都使用这种蒸馏 KL 损失进行训练,以匹配该专家的 token。多个模型已经表明,这种类型的监督对模型非常有用。你可以将其与其他 RL 损失结合,例如可验证奖励,例如,Sasha Rush 对此做了一个很好的简短介绍,以及他们如何将其与 Composer 一起使用,这是一个我强烈推荐大家观看的视频。但关键是,它是一个不同的损失函数,但它与人们已经在使用的 RL 框架配合得很好。所以他们使用这些教师……
00:24:45 Finbarr Timbers:只是 RL,就像,如果你……
00:24:47 Nathan Lambert:是的。
00:24:47 Finbarr Timbers:……实际实现它,你知道,我正在和 AI2 的一些人讨论现在实现它。就像你拿你的 RL 设置,然后你只是,你知道,你对学习器做一些调整来实际实现它。所以这相当直接。
00:25:02 Nathan Lambert:是的,这是一个花哨的图表,让它比需要的更复杂,但它也是一个非常好的图表,显示了各种领域教师,搜索 agent、代码 agent、数学、推理、安全,以及他们如何将这些组合在一起。专家既用于 SFT 数据,也用于最终的监督。专家的方案看起来有点像这个 DeepSeek 方案,它本身很复杂,就像制作一个非常擅长一件事的推理模型。
00:25:29 Finbarr Timbers:嗯,我认为它很复杂,但如果你把自己想象成实际研究它的人,就像,你有一个基座模型,然后你有一个 RL 设置,你知道,你只是不断更新两者,然后重新运行 RL。所以,最复杂的部分只是写下历史并追踪一切。但这是一种非常自然、有机的方式,让 RL 通过迭代实验来演进。
00:25:57 Nathan Lambert:是的。所以一旦你有了一个方案,你就在逐步调整每个部分,它相当稳定,但从头开始重建很难。所以我们会看看方案形态能持续多久,但可能是几年。另一个在这方面也分享了很多细节的大模型是 Nemotron-3 Ultra,显然对我来说,有一个美国制造的、性能非常强的模型是令人兴奋的,NVIDIA 还发布了大量数据集。但他们也谈到了很多非常详细的实现细节,关于在线策略蒸馏的难点。我,我好像在某处有笔记。他们做了两轮在线策略蒸馏,因为他们发现依次整合一些教师效果更好。论文中有更多细节。我不想滚动浏览论文,但我们也可以这样做。你还有其他印象吗?我们有另一个文档可以调出来……
00:27:01 Finbarr Timbers:哦。
00:27:01 Nathan Lambert:……你可能也有其他细节。
00:27:03 Finbarr Timbers:是的。嗯,我认为另一件值得对比的是 Nemotron-3 Super 论文。因为在 Nemotron-3 Super 论文中,他们有一个类似的复杂方案,但他们做了多轮 RL。在那里,他们做了三轮 RLVR,然后是一轮软件工程 RL,然后是一轮 RLHF。所以看到他们从那样做,你知道,我所见过的最复杂的 RL 设置之一,就连续阶段而言,然后转到这个设置,它仍然复杂,但在概念上简单得多,这真的很有趣。
00:27:54 Nathan Lambert:是的。我把论文收起来了。对我来说很难……我,我好像高亮了一些细节。有趣的部分大致是关于 NVIDIA 在所有教师上的各种细节。他们的论文中关于训练所有教师的细节太多了……
00:28:10 Finbarr Timbers:是的。
00:28:10 Nathan Lambert:……我认为,好的,我有一些。我这里有部分内容。我有一个有趣的引用,比如,“我们进行在线策略、多教师在线策略蒸馏试验的一个关键发现是,使用本质上不同训练流水线训练的教师模型无法通过直接的在线策略蒸馏合并有效组合,导致性能次优。”所以,他们必须做一些跨教师对齐,嗯,以确保它们实际上是相似的,我觉得这可能会成为一个组织上的噩梦。就像他们说的,“我们假设,当教师和学生使用不同的 SFT 数据训练时,它们会获得不同的推理行为并诱导不同的输出分布。这种分布不匹配可能导致学生生成的轨迹对于教师来说是分布外的,从而降低教师提供的监督信号的质量和可靠性。”
00:29:00 Finbarr Timbers:是的,这实际上很有趣,因为有一篇论文,我记不起名字了,但我最近读了一篇论文,它声称你需要做的是不断……所以,你知道,你可以做的一件事,也是显而易见的事,是你拿你的基座模型,对吧?你做任何通用的 SFT,然后你做一堆 RL,训练领域特定的 agent,一直训练到它们收敛或者你花光了钱。嗯,然后你拿这些最终的专家,然后你做某种在线策略蒸馏,将它们组合成你的最终模型。嗯,但是在那篇论文中,我会试着找到它然后给你,看看我们能否分享。他们声称的是,你需要使用正在训练中的模型,而不是收敛后的模型,以连续阶段的方式进行。所以,如果你训练你的 RL 一千步,你不能使用一千步的 checkpoint 来进行在线策略蒸馏。你必须分阶段进行,首先使用二百五十步的 checkpoint,然后是五百步的,逐渐让那个基座模型跟上速度,否则会有太大的分歧,KL 散度会太大而无法学习。
00:30:17 Nathan Lambert:是的。
00:30:18 Finbarr Timbers:……无法从中学习。
00:30:19 Nathan Lambert:是的。所以本质上,我读过的这段的最后一句是,“我们在实践中遇到了这个问题,因为教师和学生模型是并行开发的。”
00:30:29 Finbarr Timbers:是的。
00:30:29 Nathan Lambert:就像他们说的,“这是一个问题,因为很难同时做所有事情。”这就是那种如果有研究在其中会非常棒的事情,我认为 NVIDIA 可以发布一些教师模型,这样人们就可以……
00:30:45 Finbarr Timbers:是的。那太好了。
00:30:45 Nathan Lambert:……如果你有教师模型和中间模型阶段,你就可以从起点开始研究多教师在线策略蒸馏,并理解训练动态。
00:30:57 Finbarr Timbers:是的。
00:30:57 Nathan Lambert:这正是我们想在 Olmo 做的事情。我们只是还没有把方案扩展到这一步。
00:31:03 Finbarr Timbers:是的,绝对。
00:31:04 Nathan Lambert:所以我会继续鼓励 NVIDIA 这样做。
00:31:07 Finbarr Timbers:那太好了。NVIDIA……
00:31:08 Nathan Lambert:我想,嗯……
00:31:08 Finbarr Timbers:……听着。
00:31:10 Nathan Lambert:他们,他们听着。另一方面是,2026 年发布的一堆模型没有做这种多教师在线策略蒸馏,它们也没有使用那么多教师。所以我认为,这个微软模型,我这么说不是贬低,让一个新团队起步很难,他们采用了一种更简单的方法来尝试获得一个可靠的模型,它有三个更通用的专家,通过 SFT 组合,然后是一个更长的 RL 运行。所以它看起来更像 DeepSeek-R1,但我怀疑他们下一步会做更细粒度的教师,并看看是否需要切换到在线策略蒸馏。
00:31:48 Finbarr Timbers:是的。我认为,在我们的一次群聊中,你把 MAI 思考模型描述为一个保守的方案。我认为这是一个非常好的描述。就像,团队提出了这个保守的方案,然后我认为他们在执行上做得非常好。因为我认为,如果你试图一次做太多改变,方案很容易在其自身的复杂性下崩溃,我在职业生涯中见过很多次。试图做太多改变,结果都很糟糕。所以我认为他们做出了一个非常好的选择。我也认为,对我来说不太清楚的是,也许你看到了一些我没看到的论文,但对我来说不太清楚的是,轨迹蒸馏 SFT 的效果如何,或者在线策略蒸馏比轨迹蒸馏 SFT 好多少。
00:32:41 Nathan Lambert:是的。就像,在最终性能上的相对幅度是多少?
00:32:45 Finbarr Timbers:是的。
00:32:45 Nathan Lambert:所以 Nemotron Ultra 论文有一个表格,显示了在线策略蒸馏相对于教师的效果有多远,他们也有起点。所以我猜这是做这个的一种潜在方式。这里,我可以直接调出来。让我切换一下。
00:33:00 Finbarr Timbers:哦,当然。
00:33:04 Nathan Lambert:所以,我打开了这个,但在另一个标签页。好的,这是这篇论文。这是第 27 页,是我刚读的那段,它也有这种……
00:33:17 Finbarr Timbers:哦,太迷人了。
00:33:18 Nathan Lambert:……这是一个很棒的表格。我之前花了一段时间看这个。所以本质上,这是他们在 SFT 之后在每个基准上的通用模型的表现。然后我认为……好的,所以 RLVR 学生相对于专业学生的恢复增益。我需要确认……好的,它标明了初始学生 checkpoint,其中 RLVR 表示初始学生 checkpoint,然后是多教师在线策略蒸馏。所以我不确定这个 SFT 列能算出什么,但你可以看到教师相对于在线策略蒸馏的位置。我认为这是我们拥有的关于相对性能增益的最接近的信息。
00:33:59 Finbarr Timbers:是的。这很迷人,因为 DeepSeek,我忘了是哪个,也许是 V3.2 论文声称,或者也许是 R1 实际上声称你可以做领域特定的……做通用阶段可以捕获其性能。但是,这似乎并不……而且,是的,然后,做领域特定的蒸馏,然后在其之上做一个通用阶段,可以捕获原始性能。但这似乎不是这里的情况。比如,差距可能不大,但大多数时候,仍然有一个相当大的……有一个显著的差距,即使它不大。所以这真的很有趣。
00:34:42 Nathan Lambert:是的。我希望这个表格和文字更清晰。我简直无法完全解析它。就像 RLVR 表示初始学生 checkpoint,然后 OPD 表示第一轮和第二轮迭代后的 checkpoint。问题是,在线策略蒸馏开始时使用的 checkpoint 是什么?
00:35:01 Finbarr Timbers:我认为是 RLVR 那个,所以他们做了一个通用的 SFT 阶段,然后做了一个 RLVR 阶段,覆盖了非教师、他们没有专门模型的领域。然后他们做 MOPD。
00:35:15 Nathan Lambert:是的。然后这与这个恢复率相符,即最终模型减去 RLVR,这将是 OPD 相对于教师的增益减去 RLVR,这将是还需要覆盖的增益。
00:35:31 Finbarr Timbers:是的。
00:35:32 Nathan Lambert:以及教师可能给你的增益。所以更多这样的研究。很高兴看到一些已经出来了。我切换回去。
00:35:43 Finbarr Timbers:是的。我发现 Nemotron 论文和 MAI 思考论文都有趣的一点是,它们没有过多谈论一些更详细的后训练决策,这些决策在其他一些论文中显示出相当强的增益。比如,我相信是 GLM 5,他们讨论了做难度课程和难度过滤阶段。
00:36:11 Nathan Lambert:是的。
00:36:12 Finbarr Timbers:而这在其他论文中并没有真正被讨论。他们说,他们不,你知道,我认为是 Qwen 2.5 使用了温度。这有点好笑。所以 Qwen K2.5 和 GLM 5 都有温度调度,而且它们声称的完全相反。一个说必须从高温开始,然后降低。另一个说必须从低温开始,然后升高。嗯,我不知道。然后,在其他一些论文中,你没有看到这种讨论,这有点有趣。
00:36:40 Nathan Lambert:是的。我仍然认为中国实验室更愿意分享非常非常细致的技术细节。NVIDIA 的论文基本上是一系列创建教师或领域特定教师的方法列表,这很有用,但我认为我不太……它读起来没那么有趣。就像,有 15 页不同的领域,所以我想,“好吧,我不需要这个。”是的,像 KBK 2.5 和 GLM 5 实际上有更相似的方案,也属于较简单的一边,就像你创建这个 SFT 阶段,然后做 RL。RL 可能是分阶段的。嗯,没有这种在线策略蒸馏。关于他们有多少专家以及他们的专家领域,讨论得少一些。我认为,很明显,你必须对这些信息持保留态度,他们如何决定呈现信息是一个重要因素。然后实际上它们可能更接近,只是没有以某种方式描述。
00:37:44 Finbarr Timbers:我认为另一个有趣的点是,你看到中国实验室似乎都在向稀疏注意力收敛,而美国实验室,至少 NVIDIA 和 AI2,似乎更向混合注意力收敛。比如,NVIDIA Nemotron Ultra 使用了 Mamba 注意力,而我们看到 DeepSeek 稀疏注意力,以及 Mimo,嗯,MSA,不管它代表什么,Mimo 稀疏注意力。所以我认为这是一个有趣的分歧。
00:38:20 Nathan Lambert:是的。我不是问这个的人,但我同意。
00:38:23 Finbarr Timbers:[笑]
00:38:23 Nathan Lambert:就像我……我经常被问到,这是为了……我们避免完全深入这个兔子洞,但我经常被问到,“中国实验室更高效吗?”我说,“我真的不知道如何给你建议,除非我每周花二十个小时来理解你方案的细节,”因为,嗯,我无法在不理解模型和后训练过程所有复杂性的情况下,给你一句“做 X”的建议。这使得从透明度的角度来看很困难。即使它完全详细,肯定仍然难以修改和研究。
00:38:42 Finbarr Timbers:是的。
00:38:42 Nathan Lambert:……如果你让 GPT 模型效率提高 1%,你就能赚到巨额利润。我认为这是一个更有效的市场机制,但是……
00:38:53 Finbarr Timbers:然后……
00:38:53 Nathan Lambert:中国实验室……
00:38:54 Finbarr Timbers:你知道……
00:38:54 Nathan Lambert:是的。
00:38:55 Finbarr Timbers:……如果你让服务 ChatGPT 更高效,Sam Altman 可以说,“嘿,给你一堆股票。”所以,是的。
00:39:02 Nathan Lambert:是的。但是,嗯……
00:39:03 Finbarr Timbers:嗯。
00:39:03 Nathan Lambert:……他们做得很好,中国实验室做了很棒的研究。
00:39:05 Finbarr Timbers:绝对。
00:39:05 Nathan Lambert:我只是认为有点不同。好的,我们可以进入更开放的话题了。
00:39:12 Finbarr Timbers:当然。
00:39:12 Nathan Lambert:我认为我们有一个文档……我们这里有一个文档里有很多东西。我相信还会有更多。你怎么看待开放模型,因为对我来说,这并不明显,你知道,我认为有一个很大的业务是提供……嗯,实际上这甚至不太清楚。你知道,我们看到一些公司提供 RL 微调服务,RL 即服务。我们看到很多公司试图提供微调即服务,但都没有真正起飞。我认为 OpenAI 已经开始关闭,我认为他们关闭了他们的 RL 微调。我认为他们可能正在关闭他们的微调。可能我搞错了。
00:45:51 Nathan Lambert:嗯,就像 Cursor 使用 Fireworks 进行他们的实际训练运行,我不太了解所有细节,但 Cursor 做了一些事情来实现快速权重转移,或者 Fireworks 做了……
00:46:01 Finbarr Timbers:是的。
00:46:01 Nathan Lambert:……快速权重转移和其他事情,以便他们能够很好地扩展他们的 RL 推理计算。所以这是一种类型。我不知道那个业务的长尾有多大,但我也认为 Tinker 是一个比大多数人预期更好的业务。它赚了一些真金白银。在层级中,我认为卖计算不是最好的业务。
00:46:23 Finbarr Timbers:是的。
00:46:23 Nathan Lambert:卖推理是很好的业务。而 Tinker 之类的 API,如果你不能将其转化为卖 token,则介于两者之间,他们可以获取一些利润率,略高于仅仅卖计算。他们显然通过以比客户更便宜的价格获得计算来获取利润……
00:46:43 Finbarr Timbers:是的。
00:46:43 Nathan Lambert:……这是他们获取的部分利润。但我不认为它像推理那样好,所以对他们来说,让这些微调 API 很好地融入推理业务是生死攸关的。
00:46:56 Finbarr Timbers:是的。
00:46:56 Nathan Lambert:因为那样你就可以在一定程度上被锁定,你在我们的基础设施上训练模型。你实际上可以拥有模型权重,但训练动态到推理的不匹配是完美的,因为你正是在我们的推理引擎上训练的,并且会从中得到你想要的东西。
00:47:11 Finbarr Timbers:是的。而且它也有助于提高利用率,因为你可以跨许多客户端共享利用率。所以我认为这很有意义。我认为对于很多用户来说,这可能是一个更好的模式。比如,我认为对于学术用户来说,这样做可能更有意义。或者,就此而言,如果你现在要开始一个新的后训练实验室,你知道,我认识一些人正在这样做。我认为从 Tinker API 之类的东西开始可能很有意义,然后,如果你想要获取那个利润率,也许你会尝试做一些更定制的事情。但如果你能使用这样的东西,那太好了,而且经济性从根本上来说更可持续。或者,它们对你来说更好,而不是试图去 CoreWeave 或其他人那里说,“嘿,我需要 10,000 台联网的 DB200,”你知道?这是一件非常昂贵的事情,特别是如果你不能一直保持运行。
00:48:14 Nathan Lambert:是的。在我问你一些更普遍的问题之前,你还有更多关于后训练的热辣观点吗?
00:48:22 Finbarr Timbers:嗯,我普遍感兴趣的一件事是,我是谈论这个的错误人选。我很想和可能是资本分配者或计算分配者的人谈谈,他们正在决定把计算放在哪里,或者在哪里雇佣团队成员。嗯,因为我有点好奇,在预训练和后训练之间分配资源的高层决策是如何做出的。嗯,因为我看到的一个普遍趋势是,你看到很多论文更侧重于其中一个。比如,我认为……所以,是的,这对我来说有点有趣,那些做这个决定的人是如何做出这个决定的,以及他们是如何思考的。
00:49:10 Nathan Lambert:是的。这是最难从实验室里挖出来的决定。我过去花时间试图让他们分享更多,但我认为这是一个非常敏感的决定,关于他们认为进展来自哪里。他们根据他们认为进展最大和投资回报率最高的地方来分配计算。所以如果你去 Anthropic,他们说,“这是我们百分比,这是我们的分布,”那么,好的,这就是实验室看到他们赌注的地方和/或他们认为自己薄弱的地方。你投入更多计算来在你感兴趣的领域取得进展,我总觉得这让很多开放研究现在变得有点无聊,因为获得计算的人作为学者和研究人员成功的可能性要大得多,这对世界来说是一个可怕的均衡,但现实如此。我不知道如何改变很多。我想问你,你对人们急于赚钱并在梯子被抽走之前加入实验室的狂热感觉如何,以及面对有意义的机会成本,人们应该为他们的职业生涯优化什么。
00:50:18 Finbarr Timbers:是的。我认为,嗯,这实际上非常及时。嗯,但是,是的,不,我认为讨论这个非常重要。我的意思是,我认为总是值得关注你正在做和花时间的事情是否会有普遍价值,或者它是否是一种非常短期的剥削类型的事情,在 RL 的探索与利用设置中。我的意思是,我在整个职业生涯中看到的是,通常支付最高的地方也是你做最有趣工作的地方,对吧?比如,如果你要去 OpenAI、Anthropic 或前沿实验室工作,他们支付很多钱。他们也有很多资源,所以你会赚很多钱并学到很多东西。嗯,嗯,所以我认为值得判断,你面临的机会是做那个,还是像 2021 年或 2022 年那样的机会,那时你可能会说,我当时在 DeepMind,然后想,好吧,我是留在 DeepMind,它支付的比加密货币少得多?我应该去搞加密货币,尝试铸造 NFT 之类的吗?我认为那会是一个错误,但是,弄清楚你是否能够做有趣的工作非常重要,同时,也要弄清楚你是否能够推动科学进步。如果你所做的更多是去数据供应商那里说,“好吧,我需要一堆数据来做点什么。”然后他们给你一堆数据,你训练一个模型,你说它好或坏。你知道,我不认为那有那么有趣,我也不认为你会学到很多东西,尽管那是可能推动模型进步的工作。我认为如果你能够更专注于科学并得出更多科学结论,那对你的长期职业生涯会好得多。我认为这就是像 AI2 和其他学术研究实验室,Marin 在这方面做得非常出色。我认为那是你可以产生很大影响的地方,因为他们没有预算去买大量数据,所以那种杠杆对他们来说不可用。因此他们必须专注于科学和推动创新,这就是你能看到像 Almix 论文这样的东西的地方,我认为这是一篇非常优秀的科学论文,而且,我认为也有意义地推动了最先进水平。
00:52:32 Nathan Lambert:是的。不,这主要是基于访问湾区的经历,每次我去的时候都会想,“天哪,这里发生了什么?”所有这些非常初级的人对他们的机会成本有太多的恐惧,而我们俩都不在湾区,所以我感觉……
00:52:46 Finbarr Timbers:不。
00:52:46 Nathan Lambert:……有点远离它,这让我有更多时间停下来思考,到底什么才是正确优化的东西?我作为已经站稳脚跟的人说这话很容易,但我认为对很多人来说,如果他们对某件事有信念,就有机会去尝试并去做,而不是跟随所有人进入加入成熟实验室或新实验室的漏斗,我很少听说作为初级人员加入这些地方的人最终承担了非常高的责任。他们要么在贡献于重要的事情,要么周围有一群很酷的人,但我没听说有多少人说,“哇,我在做最高杠杆和最有趣的事情。”
00:53:30 Finbarr Timbers:嗯,我认为,对我来说说这个有点好笑,因为我的职业生涯更偏向机会主义一边。嗯,但是,现在两次了,我在一些组织工作……在 DeepMind,我是阿尔伯塔办公室的一员,DeepMind 收购了阿尔伯塔大学的计算机扑克研究小组。所以,这是一群真正投入于计算博弈论和扑克算法的人。他们全身心投入其中,以至于他们是该领域两个领先实验室之一,并且因为他们在这方面如此强大,DeepMind 来了,收购了他们,他们都加入了,并且从那笔收购中做得相当好。然后,我后来加入是因为我有兴趣与他们合作,做博弈论之类的事情。但是,正是这群人坚信他们所做的是非常重要的,而且结果对他们来说相当不错。然后,在 AI2 也是如此,在 AI2,有很多人对 NLP 研究非常感兴趣,甚至在语言模型出现之前。比如,我们看到像 Kyle 和 Dirk 这样的人,我想他们都在 AI2 待了将近十年。他们有非常长的任期,然后他们做得很好,然后从那之后,他们有一些很好的机会。我认为那里的一致主题是,如果你对你所做的事情有很高的信念,认为它重要且有趣,那么追随它并努力在那个领域变得非常强大,就不是一个错误。
00:55:15 Nathan Lambert:是的。我主要认为,对世界来说,拥有更多样化的方法是有益的。
00:55:19 Finbarr Timbers:是的。
00:55:19 Nathan Lambert:看看那些交易实验室如果能够做出多样化的事情,实际上会产生什么,会很有趣。我个人的想法是,它们现在太大了,大多数最终都需要做一些有点相似的事情,这……
00:55:33 Finbarr Timbers:是的。
00:55:34 Nathan Lambert:……很难,但它们需要不断冒险,它们实际上需要冒着 200 亿美元估值的风险去做一些有趣的事情,而不仅仅是会被 OpenAI 或 Anthropic 的副项目碾压。
00:55:48 Finbarr Timbers:是的,绝对。我认为这很艰难,因为当你融资时,当你进行这些巨额种子轮融资,筹集 2 亿或 10 亿美元时,你必须很快展示结果才能……
00:56:01 Nathan Lambert:是的。
00:56:01 Finbarr Timbers:……在此基础上发展。
00:56:04 Nathan Lambert:是的。所以,一个待续的对话。
00:56:11 Nathan Lambert:还有什么要说的吗?如果我们没有更多要补充的,我不需要硬拖时间。
00:56:16 Finbarr Timbers:不,我认为这相当不错。我认为能有机会聊聊这些真是太好了。你知道,我一直在阅读所有这些论文,思考所有不同的方案,所以能聊一聊并把它们传播出去真是太好了。所以,是的,谢谢你邀请我。
00:56:31 Nathan Lambert:是的,谢谢你回来。我们很快再聊。
00:56:33 Finbarr Timbers:听起来不错。