# 序章 金牌与草莓

> 本章问题：这到底是一种什么样的智能？
> 来源：https://llm.weiborao.link/#ch0

2025 年 7 月，国际数学奥林匹克竞赛（IMO）结束后不久，Google DeepMind 宣布：他们的 Gemini Deep Think 在 6 道题里完整解出 5 道，得 35 分（满分 42），达到金牌线。证明用自然语言写成，在 4.5 小时的比赛时限内完成，并由 IMO 的协调员按正式标准评分。几乎同一时间，OpenAI 也宣布自己的实验性推理模型达到了金牌水平。

IMO 是全世界最聪明的中学生之间的较量。按 DeepMind 在公告里的说明，奖牌只授予成绩排在前一半的选手，其中只有约 8% 能拿到金牌。

现在把时间往回拨一年。2024 年夏天，网上流行一个小测试：问 AI “strawberry 这个单词里有几个 r？”。正确答案是 3 个。据 TechCrunch 2024 年 8 月的报道，当时最流行的 GPT-4o 和 Claude 都曾回答 **2 个**。

> 【图示】左边：2025 年 7 月，AI 在国际数学奥林匹克竞赛中解出 6 题中的 5 题，得 35 分（满分 42），达到金牌线。右边：2024 年，同类模型被问 strawberry 里有几个 r，回答 2 个；因为它看到的不是 10 个字母，而是 straw 和 berry 两个 Token。

**图 0-1** 左边是 2025 年 7 月的奥赛成绩，右边是 2024 年的“草莓测试”。两者不是同一个模型，也不在同一年，但它们是同一类技术——大语言模型。右下角是这个反差的线索：模型看到的不是 10 个字母，而是两个编号。

公平地说，这两件事不是同一个模型在同一天做到的，模型也一直在改进。而且有一个办法能让模型数对：先把单词一个字母一个字母地写出来，再逐个数（第 3 章会解释为什么有效）。可是“需要先拼出来才能数”这件事本身就很说明问题：**一个能写竞赛级证明的系统，看单词的方式和我们完全不同**。

**停一下：先别往下读。凭你现在的直觉猜一猜：一个能写数学证明的系统，为什么会数错字母？**

**参考答案：**

常见的猜测有三种：“它太粗心”“它其实没理解，只是在背答案”“它故意的”。这三种都不对。真正的原因藏在它“看”文字的方式里：它看到的不是一个个字母，而是一块块被编了号的片段，这些片段叫 Token。straw 是一个编号，berry 是另一个编号，编号里没有“字母”这个概念。第 3 章会把这件事讲透。

### 0.1 一个反差，三个问题

这个反差背后，藏着本书要回答的三个问题。

问：它到底“懂”不懂？

答：先别急着下结论。我们得先知道它在做什么，再讨论它懂不懂。答案会在第 4 章出现，而且比“懂”或“不懂”都更有意思。

问：它是怎么学会解奥数题的？没有人把解法写进程序里吧？

答：没有。没有人给它写过一条数学规则。它的能力来自“读”了海量文字之后自己调出来的几千亿个数字。第 1、2 章讲这是怎么回事。

问：那这种能力要花多大代价？

答：很大。训练一个这样的模型，用一块顶级显卡要算上几千年，所以需要上万块显卡连在一起，组成一座“AI 工厂”。第 9 到 14 章会走进这座工厂，并拆开一份真实的“建厂图纸”。

### 0.2 一句话的答案

如果你只想带走一句话，那就是网页版封面上那台终端正在生成的那句：

大语言模型只做一件事它只做一件事：根据前面的文字，猜下一个词。

这句话本身也是按这个方式生成的：每个方块是一个 Token，模型每次只吐出一个，吐完把它接到前文后面，再猜下一个。你在聊天窗口里看到的“打字机效果”，并不是为了好看而故意放慢的动画，它就是模型真实的工作节奏。

听起来简单得过分。“猜下一个词”和“解奥数题”之间，隔着整整一本书的距离。这本书要做的，就是一块一块地把中间的台阶搭起来。

类比：

想象一个从小只靠**听**学会说话的人。他能讨论哲学、背诵诗歌、讲出漂亮的论证，却从没见过文字。你问他“草莓这个词有几个笔画”，他会愣住，因为他脑子里的“草莓”是一个整体的声音，不是一笔一画。大语言模型有点像他：它的基本单位是 Token，而不是字母。

这个类比在一个地方会失效：那个人至少还有眼睛和手，模型最初连这些都没有，只有文字。

##### 本书讨论的是

- 大语言模型怎样工作、怎样训练、为什么有效
- 它怎样变成会做事的 Agent
- 承载它的 GPU、网络、存储与软件

##### 本书不讨论

- AI 有没有意识、会不会毁灭人类
- 哪家公司的模型“最强”（排名每隔几周就变）
- 数学推导（需要的数学只有加法、乘法和“取对数”的直觉）

### 0.3 这本书怎么读

全书按“黄金圈”分成三段：先问**为什么**（这是一种什么智能、它从哪里来），再问**怎样做**（它怎样学、怎样回答、怎样查资料、怎样做事），最后问**是什么**（承载它的物理世界）。每一章只回答一个问题，而这个问题都由上一章的结论引出。

表 0-1 书里会反复出现的几种“积木”

| 标记 | 作用 | 建议读法 |
| --- | --- | --- |
| 问 / 答 | 苏格拉底式对话，让结论从问题里长出来 | 先自己回答“问”，再看“答” |
| 停一下 | 一个需要想一想的问题，答案折叠起来 | 真的停下来猜一次，猜错比猜对收获大 |
| 类比 | 给新概念一个熟悉的形状 | 同时留意类比在哪里失效 |
| 是 / 不是 | 划出概念的边界，防止误读 | “不是”那一栏往往最有用 |
| Token 方块 | 模型眼中的文字单位 | 看到方块，就是在用模型的眼睛看 |
| 网页版交互 | 拖动、单步、动画 | EPUB 读者看对应的静态图与表即可，信息不缺 |

数字方面，本书只用论文、官方模型卡和厂商规格页上的数字；自己推算的会标为估算，并把推导写在附录里。AI 领域变化很快，凡是“最新”的内容，都以资料截止日 2026 年 10 月 8 日为准。

### 0.4 一张认知地图

在出发之前，先看一眼全貌。今天的 AI 不是一个单独的程序，而是一摞层层依赖的技术：最上面是你直接用到的应用，最下面是 GPU 和网线。下面这张“认知地图”把它们分成七层，并标出了每一层在本书哪一章展开。

> 【图示】AI 认知地图：从上到下七层。应用层（聊天助手、编程 Agent、研究助手、物理 AI），认知引擎层（RAG 与评测），模型层（Transformer、训练、推理），数据表示层（Token、嵌入、向量数据库），软件调度层（Kubernetes、CUDA、NCCL），算力层（GPU、显存、NVLink），网络层（RoCEv2、InfiniBand、超以太网）。左侧地基是神经网络与学习，右侧贯穿全部层的是 AI 工厂。

**图 0-2** AI 认知地图。七层从上到下：应用、认知引擎、模型、数据表示、软件调度、算力、网络。左边的“地基”是神经网络与学习，右边贯穿所有层的是 AI 工厂。本书的问题链大致是从地基出发，自中间向上走到应用，再向下走到硅片与网络，最后把它们组装成工厂。

问：为什么要先看地图，而不是直接从第 1 章读起？

答：因为后面每一章都只盯着一层。有了地图，你随时知道自己站在哪一层、它依赖下面哪一层、又在为上面哪一层服务。读到第 11 章的网络细节时，不会忘了它最终是为了让应用层那句回答更快一点。

这张图是在作者此前发布的[“AI 认知地图”](https://weiborao.link/aicogmap.html)基础上更新的：层次和章节对应关系按本书重新组织，数字和说法则按本书的事实核查标准做了修订。

##### 本章带走

一个能拿奥数金牌线的系统，会数错 strawberry 里的 r。这不是粗心，而是线索。

- 大语言模型只做一件事：根据前文，一次一个 Token 地猜下一个词。
- 它看到的不是字母，而是被编了号的片段（Token）。
- 它的能力不是被人写进去的规则，而是从海量文字里“学”出来的。

**于是，下一个问题**：没有人把解题规则写进它的程序里，那它的能力从哪里来？机器是怎样从“被告诉规则”走到“自己学规则”的？
