# 尾章 回到草莓

> 本章问题：我们得到了什么？还剩下什么问题？
> 来源：https://llm.weiborao.link/#ch15

**上一章留下的问题：**回到起点：一个能拿奥数金牌线的系统，为什么会数错 strawberry 里的 r？走完这一路，你能自己解释了吗？

序章里，这个反差像一个谜。现在请你先合上书，试着用自己的话解释一遍，再往下看。

**停一下：用三到五句话，解释“金牌与草莓”为什么同时成立。**

**参考答案：**

参考答案：大语言模型只做一件事——根据前文预测下一个 Token。为了在海量文字上把这件事做好，它被迫把语法、事实和推理的规律压缩进参数，这让它能一步步写出数学证明；推理强化学习和“先写草稿再作答”又放大了这种能力（金牌）。但它看文字的基本单位是 Token，不是字母：strawberry 是两个编号，编号里没有字母，所以数字母这种“看包裹里面”的任务，反而需要它先把单词一个字母一个字母地写出来（草莓）。两件事来自同一套机制的两个侧面。

如果你的答案和上面差不多，这本书就完成了它最重要的承诺。不妨翻回序章的图 0-2“AI 认知地图”：现在七层里的每一个词，你应该都能说出它是什么、为什么需要它。下面再用一张图把全书的因果链串起来。

> 【图示】全书一张图：文字切成 Token，变成向量，经 Transformer 预测下一个 Token；训练把规律压缩进参数，推理一个个展开成 Token；RAG 让它开卷，Agent 让它行动；这一切落到 GPU 上的矩阵乘法，靠集合通信和网络把上万块 GPU 连起来，最后组装成把电变成 Token 的 AI 工厂，并由参考架构写成可复制的建厂图纸。

**图 15-1** 全书的问题链压成一张图。从上往下，是从“一个 Token”到“一座工厂”；从下往上读，每一层都在为“把下一个 Token 猜得更好、更快、更便宜”服务。

### 15.1 三句话

全书反复出现过三句话。现在你应该能自己把它们推出来了：

预测得*足够好*，就必须理解得*足够深*。

因为“猜下一个词”是一个可以无限变难的任务，而参数装不下原文，模型只能去学规律（第 4 章）。

一切都是 Token：  
输入是 *Token*，思考是 Token，*行动也是 Token*。

文字被切成 Token（第 3 章），推理模型用 Token 当草稿纸（第 5 章），Agent 用 Token 描述行动（第 8 章）。所以 Token 既是模型的语言，也是 AI 的计量单位和成本单位。

AI 工厂把*电*变成 *Token*，  
速度由最慢的那一环决定。

每个 Token 都是矩阵乘法，一块卡算不完、装不下（第 9 章），上万块卡要不停地对答案（第 10 章），对答案的路不能堵（第 11 章），工厂的每一层都可能成为瓶颈（第 12 章），而参考架构把这些经验写成了可复制的图纸（第 13、14 章）。

### 15.2 本书的核心贡献

1. **一句话的 LLM。**大语言模型是一个用几千亿个参数、被训练来预测下一个 Token 的深度神经网络；模型下载下来就是一份配置加一堆数字。
2. **一条因果链。**文本 → Token → 向量 → 注意力与前馈 → 下一个 Token 的概率 → 采样 → 循环。
3. **一个解释。**“预测即压缩”：数据是原矿，算法是模具与工艺，算力是打磨次数；缩放定律让投入与效果可以预测。
4. **一张训练地图。**预训练给知识，微调给格式，对齐给偏好，推理强化学习给“先想再答”。
5. **一套推理直觉。**预填充算力密集、解码带宽密集；KV 缓存吃显存；温度决定稳与活。
6. **两把扩展的钥匙。**RAG 让模型开卷，靠向量检索和“忠实度”评价；Agent 让模型行动，靠工具、循环和权限管控。
7. **一把尺子。**“一块 GPU 要算多久”：Llama 3.1 405B 约 3,000 年，1.6 万块卡约 70 天。
8. **一个精确的定义。**AI 工厂是为 AI 全生命周期设计的全栈基础设施：输入电和数据，产出 Token，以 Token 吞吐量、每瓦 Token 和每 Token 成本衡量。黄仁勋的说法是：“给它注入能量，它就会生产出非常有价值的产品，这些产品就叫做 token。”
9. **一套建厂图纸。**NVIDIA 企业参考架构：认证节点、集群设计、软件设计三层；C‑G‑N‑B 代号（如 2-8-9-400）；4 台服务器一个可扩展单元；东西向轨道优化、南北向走 DPU；每 GPU 带宽配额东西向 400、客户 25、存储 12.5 Gb/s。
10. **一座工厂的瓶颈观。**算力、网络、存储、软件、管理五要素，加上电力散热与安全；训练重同步，推理重延迟与成本；网络从 ECMP 走向逐包喷洒与超以太网；许多机房每柜不到 20 kW，这道物理门槛决定了能建哪一种工厂。

### 15.3 留给你的问题

好的解释不应该在最后一页结束。下面几个问题没有标准答案，留给你在工作和生活里继续想：

1. 如果“预测得足够好就必须理解得足够深”，那么“理解”是什么？模型和人之间，哪些差别是程度上的，哪些是种类上的？
2. 你的工作里，有哪些部分本质上也是“根据前文猜下一步”？哪些不是？前者会怎样被 Agent 改变？
3. 如果高质量的人类文本快用完了，“规律的原矿”还能从哪里来：合成数据、真实世界的交互、还是可自动判分的任务？
4. 当 Agent 能独立工作几个小时、调用公司的系统时，“谁对结果负责”应该怎样设计？
5. 如果你今天要为团队建一个 AI 平台，你会先回答哪三个问题？按 C-G-N-B 写出你需要的节点，它属于哪个家族？最慢的那一环可能在哪里？
6. 黄仁勋说“计算能力就是营收”。在你的行业里，什么样的业务能让每个 Token 真正产生收入？如果不能，AI 工厂的投资回报从哪里来？

最后，请回到网页版封面上的那台终端（读 EPUB 的话，就在脑子里想象它），把温度调到 0，再调到 2，各生成一次。现在你知道，屏幕上每一个方块的背后，是一个概率分布、几千亿次乘法、几次跨越 GPU 的“对答案”，以及一座工厂里的电。
