Interconnects · Nathan Lambert

我的新训练后教材中你将学到的5个实用内容(现已发售!)

5 useful things you'll learn in my new post-training textbook (shipping now!)

二〇二六年八月十日 · 英文原文

Nathan Lambert 所著《Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs》由 Manning 出版,全书约 25% 内容聚焦强化学习(RL),涵盖策略梯度、PPO、GRPO、GSPO、CISPO 等算法,并讲解异步 RL 系统、损失聚合、截断重要性采样及蒸馏(第 12 章)等主题。书中梳理后训练历史,涉及过度优化、正则化、评估与角色训练。该书免费在线提供,附带 12 小时课程,Manning 折扣码 PBLambert 至 8 月 19 日有效。

家务说明:这篇快速“发布”帖没有配音。更多文章即将推出!经过数年抽空记录训练开源模型的经验教训,我的后训练(post-training)一书终于完成了!该书由 Manning 出版,书名为《Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs》。讲述这本书的来龙去脉,有助于解释为什么你可能需要一本。

这本书最初是一个网站,我想记录后训练的关键方法,这些方法在网上几乎没有解释材料。如果有的话,我也找不到。考虑到后训练在 2024 年(我购买域名时)已经很流行,这类主题比我预期的要多,而且至今仍在增加。像拒绝采样(rejection sampling)、结果奖励模型(outcome reward models)和角色训练(character training)等主题就是典型例子。这帮助网站变得相当受欢迎,因为它仍然是少数几个以基础、直观方式讨论这些主题的地方之一。

除此之外,这本书的大部分内容在于传达直觉和历史。LLM 行业的许多核心技术在近几年变化不大。这本书是我尝试用简单的语言解释后训练为何有效、人们需要做出哪些权衡才能做好,以及人们常陷入哪些误解。为此,Interconnects 上一些较早的基础性博客文章被重新整理,以串联起关键数学主题背后的故事。因此,很多解释性文字可能比一般教科书更具个人色彩。这是我希望几年前刚开始时能读到的一本书!鉴于仍有很多人问我基本的后训练问题——事实上这个群体还在加速扩大——我预计这本书会广受欢迎。我本人仍经常使用这本书,也听说业内各地的资深研究者同样如此。所以,它不是一本入门书——更适合已经完成计算机科学本科学位的人——但如果你掌握了它,你在后训练的世界观上会远远领先。

分享

给读者的折扣!这本书也在网上免费提供,并附带完整的 12 小时课程(YouTube 上的幻灯片+视频)、一个简单的代码库及建议练习,以及模型完成度对比。在 Manning 上使用代码 PBLambert 可享受 50% 折扣,直到 8 月 19 日。

从 Manning 购买我的书 在 Amazon 购买我的书

是的,这本书的书名有点过时——我在出版过程中学到了一些教训,也经历了一些斗争——但我可以保证内容非常新鲜。我经常在研究工作中引用这本书,也听说朋友们这样做。我在最后一刻添加了关于在线策略蒸馏(on-policy distillation)的章节!这本书现在从 Manning 和 Amazon US 发货,Amazon UK 则在 10 月发货。

  1. 对 RL 算法如何改变模型输出的直觉

按字数或页数计算,这本书大约 25% 是关于强化学习(RL)的。这似乎很合适。如果说这本书在做一件事,那就是教人们如何思考各种 RL 算法。这种直觉——从策略梯度定理到 PPO,再到 GSPO 和 CISPO 等现代版本——对于判断一个新算法是假的还是有潜力至关重要(没有新算法会一开始就被证明正确)。下面是一个示例直觉,读完后你应该能理解。

例如,这里有一个我们反复迭代的关于 PPO 裁剪理解的趣味图。归根结底,PPO 的替代目标可以归结为六个区域。这些可以看作两个梯度,当某个 token 的优势为正或负时,取决于策略比率的当前值。对于完成序列中的单个样本,它位于此图的某个位置。如果它是批次中的第一个梯度步骤,它从 x 轴上的 1 开始(梯度始终流动),然后根据 RL 策略行为改变后比率的更新方式,梯度要么保持不变,要么变为 0(这正是裁剪参数的作用)。这种直觉非常贴近系统设计方式,以便管理梯度及其往往引起的数值问题。

以数学为重点的策略梯度部分相当详尽,涵盖了过去三年你可能听说过的所有算法:

  1. 理解新 RL 系统和算法面临的关键因素

现代 RL 的大部分是一个系统问题,需要在几个问题之间取得平衡——数据的离策略程度、训练-推理不匹配以及吞吐量。核心系统设计——异步 RL,学习器(执行梯度步骤的 GPU)和行动器(在环境中生成 rollouts 的 GPU)使用独立的 GPU——已经几年没有太大变化。智能体任务只是在这些基础之上增加了更多基础设施。

这本书旨在成为从大约零 LLM RL 知识开始并准备动手调整系统的最简单资源。它从基础开始,例如解释实现 RL 算法的一般形式:

pg_loss = -advantages * ratio

然后继续教你损失聚合(loss aggregation)——这一思想催生了 DAPO 和 Dr. GRPO 作为一些开创性的早期 GRPO 变体——以及截断重要性采样(truncated importance sampling)——这是早期 RL 实验中使 PPO 工作的技术。

分享

  1. 通向现代后训练的历史

了解一个领域如何形成一直让我着迷。当你成为专家时,比任何人都更了解自己领域的历史,这让你能做出最好的预测(Bill Gurley 在他最近的书中也给出了类似建议)。在深度学习基础(如 transformer)被构建的时代,现代后训练的核心也在对齐(alignment)领域诞生。这本书将带你走过三个时代:研究者们大致到 2018 年学会如何在偏好上做 RL,2019 到 2022 年花几年时间学习如何将其应用于语言模型,以及从 2023 年开始利用 ChatGPT 树立的范例。就像早期扩展 LLM 的人们一样,十年前创建这个领域的人对现代进展的展开方式值得极大的赞誉。书的第 2 章是这方面的速成课,但整本书都充满了这种思考。

  1. 揭开“蒸馏”的神秘面纱

鉴于当前更广泛的 AI 政策讨论,有一章关于蒸馏的枯燥教科书章节真是太好了。这一章(第 12 章)解释了 LLM 输出用于训练下游模型的各种行业标准方式。当这项技术经常被以负面方式描述,并被当作地缘政治竞争工具时,拿出一本 300 页的教科书向某人解释他们所攻击的术语有多宽泛,是一种降级行动。这样,第 10 到 12 章都是关于让数据行业中一些不透明的做法对读者更清晰。

蒸馏章节延续了我上面概述的主题,解释了从 2015 年的早期知识蒸馏文献过渡到 2-3 个关键见解所需的关键变化,这些见解让我们走到了像小米 MiMo-V2-Flash 和 DeepSeek V4 这样的模型的多教师在线策略蒸馏(MOPD)。

  1. 对做好后训练时遇到的各种小麻烦的综述

这本书的后半部分深入探讨了过度优化、正则化、评估和角色训练,这些都是关于后训练可能出错的各种方式以及你需要掌握什么。这是这本书与那些只是代码练习和方程列表的书最大的区别,但它解释了诸如为什么 RL 在 SFT 遗忘时能泛化(在数学层面),或者前沿实验室使用哪些技术来塑造模型个性以及为什么这些往往走得太远。这本书呈现了你将使用的工具,然后打开了当你真正尝试使用它们时将要面临的所有挑战的闸门。

当我写这本书的要点时,我想起了我早年给 AI 时代创业公司的一条建议,以及人们现在确实需要关心研究。随着 AI 进步的速度,一篇研究论文落地到前沿模型需要 3-9 个月。以前在大型科技公司,这需要数年,所以对新研究采取放手态度是可以的。对于依赖在 LLM 特定细分领域保持前沿的公司来说,今天的动态可能成就或毁掉公司。这本书很有用,因为它训练你理解哪些研究重要——它帮助你培养研究品味。

如果这些都不引起你的共鸣,你应该买我的书,因为这让我开心,而且我在所有这些方面都非常努力。我真的很喜欢这张照片。

译自 Interconnects · Nathan Lambert · 录于 二〇二六年八月十日