# 第 5 章 从会续写到会听话：训练的五个阶段

> 本章问题：基座模型怎样变成助手？推理模型又多了什么？
> 来源：https://llm.weiborao.link/#ch5

**上一章留下的问题：**按这种方式训练出来的模型，只会接着前文往下写。你问它一个问题，它可能接着写出五个类似的问题。它是怎样变成一个会听话、会推理的助手的？

第 4 章讲的“在海量文字上猜下一个词”，只是训练的第一大步。它造出来的模型叫**基座模型**：知识渊博，但还不会当助手。本章把一个基座模型变成 ChatGPT 这样的助手、再变成会“先想再答”的推理模型，一共要走五个阶段。

### 5.1 基座模型的“毛病”

基座模型只学过一件事：**像互联网那样续写**。于是它的行为也像互联网：

你输入怎样学好英语？

基座模型可能的续写（示意）怎样学好数学？怎样学好物理？……

在它读过的网页里，一个问句后面常常跟着另一个问句（比如论坛的帖子列表）。它没有错，它只是在做被训练去做的事。它还会模仿网上的偏见与恶意，会一本正经地编造，也不知道什么时候该拒绝。

问：基座模型已经“读遍图书馆”，知识都在。它缺的是什么？

答：缺“怎样当一个助手”的规矩：别人问问题时要回答，而不是出新题；回答要有用、要诚实，不能帮人干坏事。

问：这些规矩需要很多数据吗？

答：比起预训练少得多。能力已经在了，要教的是“格式”和“偏好”。

### 5.2 五个阶段

> 【图示】大语言模型训练的生命周期：一，数据准备：收集、去重、过滤、脱敏；二，预训练：在数万亿 Token 上猜下一个词，得到基座模型；三，监督微调：学人写的指令与回答示范；四，偏好对齐：用人的偏好打分来调整；五，推理强化学习：在有标准答案的题目上练习，学会先想再答。

**图 5-1** 一个大语言模型的训练生命周期。预训练用掉绝大部分算力，得到“知识”；后面三个阶段规模小得多，得到“好用”。右列是贯穿本节的类比。

类比：

把模型想成一个**医学生**。预训练是在图书馆里读完所有医学书和病历，知道得很多，但没见过病人；监督微调是跟着老医生学问诊，看老师怎样一句句回答病人；偏好对齐是听病人和导师的评价，知道哪种说法让人满意、哪种会伤人；推理强化学习是刷大量有标准答案的病例考题，学会先想清楚再下诊断。

#### ① 数据准备

从网页、书籍、百科、论文、代码中收集文本，再做大量清洗：去掉重复内容、过滤低质和有害内容、删除个人隐私信息。数据的质量往往比数量更重要，这一步是各家公司最不愿公开的“配方”之一。

#### ② 预训练：得到知识

也就是第 4 章讲的过程：在数万亿 Token 上猜下一个词。Llama 3.1 405B 用了 15.6 万亿 Token。这一步耗时几个月、用掉上万块 GPU，第 9 章会算一算它到底有多贵。产物是基座模型。

#### ③ 监督微调：学会格式

由人写出成千上万组“指令 → 好回答”的示范，比如“把这段话翻译成英文 → 译文”“解释量子纠缠 → 一段清楚的解释”，让模型在这些示范上继续做“猜下一个词”的训练。训练目标没有变，变的是数据：它现在模仿的是一个好助手，而不是整个互联网。这一步也叫**指令微调**。

#### ④ 偏好对齐：学会“什么是好”

示范总是有限的，而且很多时候“好”难以写出来，却容易比较出来：同一个问题的两个回答，人往往一眼就能看出哪个更好。**基于人类反馈的强化学习**（RLHF）利用的就是这一点。

> 【图示】基于人类反馈的强化学习：模型对同一个问题生成两个回答；标注员判断哪个更好；用大量这样的比较训练一个奖励模型；再让语言模型朝奖励更高的方向调整，循环往复。

**图 5-2** RLHF 的循环。人只需要做“比较”，奖励模型把成千上万次比较学成一个自动打分器，再用它去大规模地调整语言模型。

对齐的目标常被概括成三个词：**有用、诚实、无害**。2022 年 3 月的 InstructGPT 论文给出了一个出人意料的对比：经过这套训练的 13 亿参数模型，回答比 1750 亿参数的原版 GPT-3 更受人偏好。后来也出现了不需要单独训练奖励模型的简化方法（如 DPO），但思想相同：用人的偏好来塑造模型的行为。

**停一下：小了一百多倍的模型，为什么回答反而更受欢迎？**

**参考答案：**

因为对一般问题来说，GPT-3 缺的不是知识，而是“好好回答”的习惯。它可能答非所问、续写出无关内容。InstructGPT 的能力未必更强，但它把能力用在了你要的地方。对齐不是往模型里加知识，而是**把已有的能力对准人的意图**。

#### ⑤ 推理强化学习：学会先想再答

人的偏好打分有两个局限：贵，而且在难题上不可靠。一道竞赛数学题，标注员自己可能都看不出哪个证明是对的。但有一类问题天然自带“判卷老师”：数学题有标准答案，代码可以运行测试。在这类问题上，模型可以自己做题、自动判分、大量练习。

2024 年 9 月，OpenAI 发布 o1，称它会在回答前“花更多时间思考”。2025 年 1 月，DeepSeek 的 R1 论文公开了类似的做法，并指出：**推理能力可以单靠强化学习激发出来，不需要人工写好的推理过程**。论文还记录了一个作者称为“顿悟时刻”（aha moment）的现象：只用强化学习训练的 R1-Zero，在一个中间版本里学会了“重新思考”，回头重新审视自己前面的解法。

### 5.3 推理模型多了什么：一张草稿纸

推理模型的结构和普通模型一样，仍然是 Transformer，仍然在猜下一个 Token。区别在于，它在给出答案之前，**先生成一大段“思考”Token**：拆解问题、列出步骤、尝试、发现错误、回头修正。

> 【图示】推理模型的回答方式：先生成一段思考 Token（草稿），在里面拆解问题、尝试、检查、纠错，然后才给出最终答案。思考越长，消耗的 Token 越多，复杂问题的正确率通常越高。

**图 5-3** 推理模型先写草稿再作答。还记得第 3 章的草莓吗？把单词逐个字母写出来，每个字母就成了一个独立的 Token，“数 r”就变成了模型擅长的事。思考 Token 是同一个道理的推广。

问：多写几个字，为什么能变聪明？

答：你心算 37 × 48 很难，在纸上列竖式就容易。不是你变聪明了，而是草稿纸把一个大问题拆成了很多个小问题，每一步只需要做一件简单的事。

问：模型的“草稿纸”在哪里？

答：就是它自己生成的 Token。模型每生成一个 Token，都要完整地算一遍整个网络。写得越多，等于算得越多；写下来的中间结果，又成了下一步可以“回头看”的前文。

这带来了一个新的“缩放”方向：除了训练时投入更多算力，**回答时投入更多算力**（让它想得更久）也能换来更好的结果。这叫**测试时计算**。代价是 Token：一个难题的“思考”可能要消耗成千上万个 Token。这个事实对后面几章很关键，因为每一个 Token 都要在 GPU 上算出来。

一切都是 Token：  
输入是 *Token*，思考是 *Token*，行动也是 Token。

“行动也是 Token”这一句，要到第 8 章讲 Agent 时才会兑现。

表 5-1 五个阶段对照

| 阶段 | 数据 | 学到什么 | 规模 |
| --- | --- | --- | --- |
| 数据准备 | 原始网页、书、代码 | （为后续准备原料） | 数十 TB 级文本 |
| 预训练 | 清洗后的海量文本 | 语言、知识、推理的规律 | 数万亿 Token，占算力的绝大部分 |
| 监督微调 | 人写的指令与回答示范 | 助手的格式与语气 | 小几个数量级 |
| 偏好对齐 | 人对回答的比较 | 什么样的回答更好、该拒绝什么 | 小几个数量级 |
| 推理强化学习 | 可自动判分的题目 | 先想再答、检查与纠错 | 增长很快，具体比例各家未公开 |

##### 对齐与推理训练能

- 让模型听懂指令、按人的偏好回答
- 让模型学会拆解问题、检查自己的步骤

##### 它们不能

- 保证模型说的都是真的（它仍然可能自信地编造）
- 凭空加入预训练里没有的知识，也不能更新知识的截止日期

##### 本章带走

预训练给模型知识，微调和对齐教它当助手，推理强化学习教它先想再答；每一步的训练目标，归根到底仍是“猜下一个 Token”。

- 基座模型像互联网一样续写；监督微调让它模仿好助手；RLHF 用人的比较来定义“好”。
- InstructGPT：13 亿参数对齐后的模型，比 1750 亿参数的 GPT-3 更受偏好。
- 推理模型用思考 Token 当草稿纸；回答时多花算力，也能换来更好的结果。

**于是，下一个问题**：训练好的模型是一个文件。当你在聊天框里按下回车，这个文件是怎样一个字一个字地把答案“吐”出来的？
