# 第 14 章 拆开一座 HGX AI 工厂

> 本章问题：从一台服务器到 1,024 块 GPU，一座 AI 工厂的每一层是怎样设计的？
> 来源：https://llm.weiborao.link/#ch14

**上一章留下的问题：**学会了读图纸，就拿一份真实的图纸来拆：一座 HGX AI 工厂，从一台服务器、一个 4 台的单元，到 128 台、1,024 块 GPU，每一根线、每一台交换机是怎样安排的？

本章拆的图纸是 NVIDIA 公开的《HGX AI Factory（HGX H100、H200、B200）》企业参考架构。它的摘要只有一句话，却浓缩了整章的内容：

> 本参考架构是 NVIDIA HGX AI 工厂的实用设计指南，基于 2-8-9-400 基础设施配置（2 颗 CPU、8 块 GPU、9 块网卡、每块 GPU 400 Gb/s 带宽），采用每节点 8 块 GPU 的 HGX H100、H200 或 B200 服务器，配合 ConnectX SuperNIC、BlueField-3 DPU 与 Spectrum-X 以太网，覆盖 32、64、128 节点的设计点。
>
> —— NVIDIA HGX AI Factory 参考架构摘要（本书译）

我们按“由小到大”的顺序拆：一台服务器 → 两种网卡 → 一个 4 台的单元 → 128 台的集群 → 三张物理网与控制面 → 一个常被问到的问题（纯推理要不要建计算网）→ Cisco 的版本。读完后，第 9 到 11 章的 GPU、NVLink、RDMA、轨道和叶脊，会在一张图纸上各就各位。

### 14.1 一台服务器：2-8-9-400

> 【图示】一台 2-8-9-400 HGX 服务器的构成：8 块 SXM GPU 装在同一块 HGX 基板上，经 NVLink 与 NVSwitch 互联；每块 GPU 配一块 400G 的 BlueField-3 SuperNIC，接入东西向计算网的第 1 到第 8 条轨道；两颗 CPU 带至少 1.5 TB 内存；一块双口 200G 的 BlueField-3 DPU 负责南北向；BMC 接 1G 带外管理网；本地 NVMe 存储。

**图 14-1** 一台 2-8-9-400 服务器。8 块 GPU 在机内经 NVSwitch 全互联（第 10 章的“第一级高速公路”）；每块 GPU 配一块 400G SuperNIC，各自接到一条“轨道”上（第二级高速公路）；南北向流量走单独的 DPU。

表 14-1 三代 HGX 的 GPU 与节点规格（参考架构表 1、表 2）

|  | H100 SXM | H200 SXM | B200 SXM |
| --- | --- | --- | --- |
| 每块 GPU 显存 | 80 GB HBM3 | 141 GB HBM3e | 180 GB HBM3e |
| 每台（8 卡）显存 | 640 GB | 约 1.1 TB | 1.44 TB |
| 每块 GPU 显存带宽 | 3.35 TB/s | 4.8 TB/s | 最高 8 TB/s |
| 每台显存总带宽 | 26.8 TB/s | 38.4 TB/s | 最高 64 TB/s |
| GPU 间 NVLink 带宽 | 900 GB/s | 900 GB/s | 1,800 GB/s |
| NVSwitch 总带宽 | 7.2 TB/s | 7.2 TB/s | 14.4 TB/s |

NVLink 带宽为 NVIDIA 常用的双向口径（收发合计），NVL72 参考架构写作“900 GB/s（双向 1,800 GB/s）”。参考架构另称 HGX H100/H200 基板提供 32 PFLOPS、HGX B200 基板提供 144 PFLOPS 的 AI 算力，B200 每块 GPU 功耗可配置到 1 kW；这些为厂商口径，精度与稀疏条件以 NVIDIA 规格页为准。

GPU 之外，参考架构对服务器的其余部分也有明确要求。它们看起来琐碎，却都对应着第 9 到 11 章里的某个瓶颈：

表 14-2 HGX 认证服务器的关键要求（节选）

| 部件 | 要求 | 为什么（对应章节） |
| --- | --- | --- |
| CPU | 至少 2 个插槽，基础频率 ≥ 2.1 GHz；每插槽至少 48 核，建议 56 核 | 数据预处理、调度和网络栈不能拖 GPU 后腿 |
| 系统内存 | 至少 1.5 TB，带宽至少 500 GB/s，各通道对称插满 | 加载模型、数据缓冲；不对称会让一颗 CPU 成为瓶颈 |
| PCIe | 每块 GPU、每块网卡各一条 Gen5 x16，均衡分布在两颗 CPU 的根端口 | GPUDirect RDMA 的短路径（第 10 章） |
| 东西向网卡 | 8 块 BlueField-3 SuperNIC，每块最高 400 Gb/s，GPU 与网卡 1:1 | 集合通信（第 10、11 章） |
| 南北向 | 1 块 BlueField-3 DPU | 存储、管理、客户接入与安全 |
| 本地存储 | 推理服务器每插槽 ≥ 1 TB NVMe；训练服务器每插槽 ≥ 2 TB；另加 1 TB 启动盘 | 数据缓存、检查点暂存 |
| 管理与安全 | BMC 带外管理；TPM 2.0 安全启动 | 可远程运维、可信启动 |

参考架构的“组件”一章写每插槽最少 48 核，“附录·节点配置”一章写最少 32 核，两处建议值均为 56 核；以对应版本文档为准。

### 14.2 两种网卡，两种分工：SuperNIC 与 DPU

一台服务器上有 9 块网卡，但它们不是同一种东西。

- **BlueField-3 B3140H SuperNIC（×8）**：单口 400 GbE，专门服务东西向计算网。它支持 RDMA/RoCE 加速和 GPUDirect，是 Spectrum-X 平台的端点：第 11 章讲的“交换机逐包喷洒、网卡把乱序整理回顺序”，就发生在这块卡上。
- **BlueField-3 B3220 DPU（×1）**：双口 200 GbE，服务南北向。参考架构列出了它的三项职责：**工作负载编排**（作为数据中心控制面的计算平台，实现自动部署与弹性）、**存储加速**（让远端存储像本地盘一样使用）、**安全基础设施**（以零信任模式独立于主机运行，提供防火墙与微隔离等安全服务）。它还内置 BMC，可以用 Redfish 等标准接口管理。

类比：

SuperNIC 像生产线之间的**专用传送带**，只管把半成品又快又准地送到下一道工序；DPU 像工厂大门口的**门卫兼收发室**：查证件、收发原料、记录进出，而且不归车间主任（主机 CPU）管，车间被攻破了，门卫照样能守住大门。

参考架构也允许变体：ConnectX-7 可用于各类网络；双口 400G 的 ConnectX-8 SuperNIC 可用于更高带宽的东西向网络，在只需要每卡 400G 时只启用一个口。

### 14.3 一个单元：4 台服务器与“轨道优化”

参考架构以 4 台服务器为一个可扩展单元（SU），并说 SU 的大小“取决于网络设备的端口数量”。一个 SU 提供的连接积木是：

**12.8 Tb/s**东西向：4 台 × 8 块 SuperNIC = 32 个 400G 连接

**1.6 Tb/s**南北向：4 台 × 1 块 DPU = 8 个 200G 连接

**48 × 1G**带外管理：每台 12 个 1G 管理口

东西向的连法叫**轨道优化**（rail-optimized）。所谓“轨道”，就是把所有服务器上同一个编号的 GPU 连到同一组叶交换机上：每台服务器的 1 号 GPU 都接到“轨道 1”，2 号都接到“轨道 2”，以此类推。

> 【图示】轨道优化的连接方式：一个可扩展单元有 4 台服务器，每台的第 k 块网卡都接到负责第 k 条轨道的叶交换机上。在 32 节点设计中，每个平面 4 台叶交换机，每台承载两条轨道：1 和 5、2 和 6、3 和 7、4 和 8。叶交换机再向上接到脊交换机。

**图 14-2** 轨道优化的接法（32 节点设计中，每个平面 4 台叶交换机，每台承载两条轨道：1+5、2+6、3+7、4+8）。为了清楚，只画了服务器 1 的连线；其余服务器按同样的编号规则接入。

问：为什么要按 GPU 编号来接，而不是把一台服务器的 8 根线都接到同一台交换机上？

答：因为分布式训练里最频繁的通信，往往发生在不同服务器上“同一位置”的 GPU 之间：比如张量并行把每层切成 8 份放在机内 8 块卡上，数据并行再在服务器之间同步，第 k 块卡要和别的服务器的第 k 块卡交换数据。按轨道接线，这些流量只经过一台叶交换机就到了。

问：那 1 号 GPU 要和另一台服务器的 2 号 GPU 通信呢？

答：先在机内经 NVLink 把数据交给本机的 2 号 GPU，再走轨道 2。机内的路按同一口径比网络快约 9 倍（第 10 章），这个“换道”很便宜。NCCL 知道这套拓扑，会自动这样安排。

参考架构对东西向网络的描述是：基于 Spectrum-X 交换机的**全无阻塞胖树**，支持 RDMA，“提供穿过网络的最短跳数”。无阻塞的意思是：叶交换机向上（到脊）的带宽不少于向下（到服务器）的带宽，任何两块 GPU 同时全速通信都不会在交换机里被卡住。这正是第 11 章说的“链路不能堵”在拓扑上的落实。

### 14.4 从 32 台到 128 台

参考架构发布了 32、64、128 台三个设计点，并给出了每个设计点需要的交换机、光模块和线缆数量。下表整理了其中最能说明“规模怎样增长”的数字：

表 14-3 HGX AI 工厂三个设计点的主要数量

|  | 32 台 | 64 台 | 128 台 |
| --- | --- | --- | --- |
| GPU / 可扩展单元 | 256 / 8 SU | 512 / 16 SU | 1,024 / 32 SU |
| 东西向叶 / 脊交换机 | 4 / 2 | 8 / 4 | 16 / 8 |
| 东西向：服务器到叶交换机的连接 | 256 | 512 | 1,024 |
| 东西向：交换机之间的线缆 | 256 | 512 | 1,024 |
| 南北向融合网交换机（SN5600） | 2 | 2 | 10 |
| 带外管理交换机（SN2201） | 4 | 8 | 16 |
| 交换机间链路（ISL）用的 2×400G 光模块 | 274 | 544 | 1,408 |

来源：参考架构表 7（东西向计数）与附录表 10（交换机与线缆汇总）。东西向“服务器到叶交换机的连接”即 SuperNIC 数，等于 GPU 数。

这张表里藏着三个规律：

1. **东西向线缆与 GPU 一一对应**：每多一块 GPU，就多一根到叶交换机的线、多一根交换机之间的线。东西向网络的规模，和 GPU 数量同步增长。
2. **每块 GPU 的带宽配额差别很大**：东西向每块 GPU 400 Gb/s；32 节点设计中，客户网络至少 25 Gb/s、存储至少 12.5 Gb/s（第 13 章图 13-5），三者之比约 32 : 2 : 1。注意三个数字都是比特每秒：存储的 12.5 Gb/s 约合每块 GPU 1.56 GB/s、每台服务器 12.5 GB/s。
3. **光模块数量增长得比 GPU 快**：GPU 从 256 增加到 1,024（4 倍），交换机间光模块从 274 增加到 1,408（约 5 倍），因为更大的规模需要更多层级的交换。这就是白皮书说“线缆和光模块的选择会影响散热、交付周期和客户体验”的原因：在大集群里，光模块是不可忽视的成本和功耗项。

**停一下：128 台服务器的东西向网络有 16 台叶交换机和 8 台脊交换机。为什么不只用几台端口更多的大交换机？**

**参考答案：**

单台交换机的端口数是有限的（SN5600 是 64 个 800G 口，拆分后为 128 个 400G 口），1,024 块 GPU 的连接装不进一台。叶脊结构用“很多台中等交换机”拼出一张大网：任意两台服务器之间最多经过“叶—脊—叶”三跳，路径多、可以负载均衡，坏一台交换机只损失一部分带宽。代价是交换机之间要大量的线缆和光模块，正是表 14-3 最后一行的数字。

### 14.5 三张物理网与控制面

> 【图示】HGX AI 工厂的三张物理网与控制面：东西向计算网连接每台服务器的 8 块 SuperNIC；南北向融合网连接每台服务器的 DPU、控制面节点、存储、客户网络和支撑服务；带外管理网连接所有设备的 BMC 与管理口。三张网的交换机分别是 SN5600/SN5610 和 SN2201。

**图 14-3** 参考架构的三张物理网：东西向计算网、南北向融合网、带外管理网。融合网在一张物理网上用 VLAN 隔离出存储、带内管理、客户接入和支撑服务等多种用途。

- **东西向计算网**：只连 GPU 的 SuperNIC，轨道优化、无阻塞；参考架构说更大的设计点会采用“超级脊—脊—叶”三层结构。
- **南北向融合网**：每台计算节点和管理节点用两个 200GbE 端口分别接到两台交换机，既冗余又提供高存储吞吐，每台服务器最高可达约 40 GB/s；支持 RoCE；用于部署节点、搬运数据、访问互联网等用户可见的服务。
- **带外管理网**：连接所有服务器 BMC、DPU 和 SuperNIC 的管理口以及交换机管理口，用低成本的 1G 交换机，并与用户物理隔离。

除了计算节点，集群还需要**控制面节点**来做部署、调度和管理。参考架构举了一个例子：同时使用 Base Command Manager、Slurm 和 Kubernetes 时，共 7 台控制面节点——Base Command Manager 2 台（高可用）、Slurm 头节点 2 台、Kubernetes 控制面 3 台。每台控制面节点建议 2 颗 32 核 CPU、至少 256 GB 内存、一块 BlueField-3 DPU。这些服务器不跑模型，但它们停了，整座工厂就失去了“厂长”。

### 14.6 只做推理，要不要建计算网

这是企业最常问的问题之一。参考架构的回答是：**纯推理部署可以不建东西向计算网**。理由是，它所针对的常见模型能放进单块 GPU 或单台服务器，跨卡的并行仍在同一台服务器内（经 NVLink）完成；而且在推理中，用张量并行把一个模型拆到多块 GPU 上，每块 GPU 的效率往往不如让各块 GPU 各跑一个副本（数据并行）。文档同时指出了代价：没有计算网，就不能运行包括小模型训练在内的混合负载；但可以先不建，日后再补。

**读这条建议时要注意时间**　这份参考架构写道“每块 GPU 最多支持约 130 亿参数的模型”，这是一个保守的经验值（大致对应 BF16 权重加上推理所需的显存余量）。NVIDIA 后来的几份参考架构给出的单卡上限随硬件增长：RTX PRO 6000 约 400 亿（FP16），B300 约 1200 亿，GB300 NVL72 单托盘（4 卡）约 1.92 万亿（FP4）（第 13 章表 13-4）。今天企业常用的模型往往更大，但第 6、9 章的计算说明，即使是 4050 亿参数的模型，按 FP8 也能放进一台 8 卡服务器，所以“单机内完成推理、不需要计算网”的结论对多数场景仍然成立。例外是：超大的混合专家模型需要跨机的专家并行，或者采用把预填充与解码拆到不同机器上的分离式推理架构，这时跨节点的低延迟网络又变得重要（第 11 章）。（本段为本书的分析。）

### 14.7 Cisco 的版本：通过评审的设计与 Secure AI Factory

参考架构由服务器厂商落地。NVIDIA 在参考架构文档页公开了各厂商通过设计评审委员会的设计，Cisco 名下列出的方案包括：

表 14-4 NVIDIA 文档页列出的 Cisco 背书设计（截至资料日期）

| 方案 | 服务器 / GPU | 节点模式 | 规模（台） |
| --- | --- | --- | --- |
| Cisco AI POD Infrastructure for the NVIDIA 2-8-9-400 RA | UCS C885A M8 / HGX H200 | 2-8-9-400 | 4–16 |
| 基于 Cisco Nexus 的 Cisco 参考架构 | UCS C885A / HGX H200 | 2-8-9-400（调整为 2-8-10-400） | 4–128 |
| Cisco Nexus Hyperfabric AI 参考架构 | UCS C885A / HGX H200 | 2-8-9-400（调整为 2-8-10-400） | 4–128 |
| Cisco N9000 RA with NVIDIA HGX B300 | UCSC-880A-M8-B306 / HGX B300（单平面与双平面） | 2-8-9-800 与 2-8-9-400 | 16、32、64、128 |
| Cisco Nexus Hyperfabric RA with NVIDIA HGX B300 | 同上 | 2-8-9-800 与 2-8-9-400 | 16、32、64、128 |
| Cisco 2-8-5-200（文档即将发布） | UCS C845A M8 / RTX PRO 6000、H200 NVL | 2-8-5-200 | 4–32 |

各方案获得的背书类别（基础设施配置、Spectrum-X 兼容、网络逻辑架构）以 NVIDIA 文档页标注为准，部分标注“含 Spectrum-X 元素”。“调整为 2-8-10-400”为 NVIDIA 页面原文，多出的网卡用途以 Cisco 对应设计文档为准。B300 方案中的 2-8-9-800 与 2-8-9-400 分别对应双平面与单平面东西向网络（第 13 章 13.4、13.5 节）。

Cisco AI POD 于 2024 年 10 月发布，建立在 Cisco 验证设计（CVD）之上，把 UCS AI 服务器（如搭载 HGX H100/H200 的 C885A M8、支持 PCIe GPU 的 C845A M8）、Nexus 网络、合作伙伴存储和软件栈组合成预配置的模块。对照表 14-4 可以看到它在 NVIDIA 体系里的位置：一个按 2-8-9-400 模式、4 到 16 台规模、通过 NVIDIA 设计评审的模块；更大规模和 B300 一代，则由基于 Nexus 与 Hyperfabric 的参考架构覆盖。对企业来说，这意味着沿用熟悉的 Nexus 运维方式（如 VXLAN EVPN 和 Nexus Dashboard），同时仍处在 NVIDIA 参考架构的“图纸”之内。

#### Secure AI Factory：给工厂装上门禁与雷达

2025 年 3 月，Cisco 与 NVIDIA 发布了 **Cisco Secure AI Factory with NVIDIA**。它的定位是：在 NVIDIA 参考架构的性能基础上，补上企业生产环境刚需的三样东西。

> 【图示】Cisco Secure AI Factory 与 NVIDIA 的分层示意：应用与模型层由 AI Defense 做红队测试和运行时防护；工作负载与集群层用 Hypershield 等混合网格防火墙防止横向移动；网络层前端可用 Silicon One、后端可用基于 Spectrum-X 的交换机；计算层是 UCS AI 服务器，用 Intersight 管理；存储层与合作伙伴联合验证；Splunk 提供贯穿各层的全栈可观测性。

**图 14-4** 按层看 Secure AI Factory 的组成。左边是每一层要防、要管的问题，右边是 Cisco 官方发布中对应的组件。

1. **每一层的安全**：在应用与模型层，**Cisco AI Defense**（2025 年 1 月发布）用算法化的红队测试评估模型，并在运行时防护提示词注入、数据泄露等新型威胁（还记得第 8 章 Agent 的风险吗）；在工作负载层，**Hypershield** 等混合网格防火墙用来阻止攻击者在集群内部横向移动。它与 14.2 节 DPU 的零信任能力互为补充：一个在网卡上，一个在网络与工作负载层。
2. **全栈可观测性**：借助 Splunk，把 GPU 利用率、网络、能耗一直到应用延迟和 Token 成本放在同一个视图里，出问题时能更快定位到底卡在哪一层。
3. **网络的选择权**：2025 年 2 月，Cisco 与 NVIDIA 宣布 Cisco Silicon One 成为 Spectrum-X 中唯一的合作伙伴芯片，同时 Cisco 也推出基于 NVIDIA Spectrum-X 交换芯片的交换机（N9100，2025 年 10 月）。2026 年 8 月，Secure AI Factory 扩展到 Vera Rubin NVL72 等机柜级系统：前端可用基于 Silicon One 的交换机，后端可用基于 Spectrum-X 的交换机。

在芯片层面，Cisco 在 2025 年 10 月推出了用于跨数据中心互联的 51.2 Tbps 路由芯片 Silicon One P200，2026 年 2 月又发布了 102.4 Tbps 的交换芯片 Silicon One G300。这些都指向同一个趋势：**单个数据中心装不下的 AI 工厂，开始跨楼、跨园区相连**。

类比：

如果说 GPU 厂商的参考架构是一份**高性能发动机和传动系统的图纸**，追求的是把速度推到物理极限；那么企业要的是一辆能在城市里每天上路的车：除了发动机，还要有**门锁、防撞雷达和仪表盘**，还要能开进现有的车库。Secure AI Factory 想做的就是后者。

##### 参考架构与验证设计能

- 降低集成风险，缩短从采购到上线的时间
- 给出经过测试的性能、网络与安全基线

##### 它们不能

- 替你决定跑什么工作负载、要多大规模
- 保证厂商宣传的性能数字在你的业务上原样复现：仍需在自己的负载上验证

### 14.8 回到那个问题：工厂为什么能输出智能

现在，读者最初的问题可以完整地回答了。**智能来自规律**：第 4 章说，预测得足够好就必须理解得足够深，训练把海量数据里的规律压缩进参数，推理再把规律展开成 Token。**压缩和展开都是天文数字的矩阵乘法**：第 9 章算过，一个 4050 亿参数的模型，一块 GPU 要算 3,000 年。**AI 工厂的作用，是把这件“一块卡算不完、装不下”的事，组织成上万块卡同步完成的事**：GPU 负责算，NVLink 和轨道优化的 RDMA 网络负责传，认证存储负责喂和存，CUDA、NCCL、Kubernetes 负责指挥，DPU、可观测性和安全负责让它稳定、可信地跑下去。参考架构则把这些经验写成了可以复制的图纸。

所以，算力、数据、算法三样东西缺一不可，而工厂决定了它们能被多快、多便宜、多可靠地组合起来。**工厂里最慢的那一环，就是整个智能的产能上限**。

##### 本章带走

一份 HGX AI 工厂图纸 = 2-8-9-400 节点 × 4 台一个单元 × 最多 32 个单元，加上三张物理网、控制面、认证存储和软件栈。

- 节点：8 块 SXM GPU 经 NVSwitch 全互联；8 块 400G SuperNIC 与 GPU 1:1；1 块 DPU 负责南北向与安全。
- 东西向：轨道优化、无阻塞胖树；每个单元 12.8 Tb/s；128 台需要 16 台叶、8 台脊交换机，光模块增长快于 GPU。
- 带宽配额：东西向 400、客户 ≥25、存储 ≥12.5 Gb/s/GPU；纯推理可先不建计算网。
- Cisco AI POD 是通过 NVIDIA 设计评审的 2-8-9-400 方案；Secure AI Factory 在其上补安全、可观测性与网络选择权。

**于是，下一个问题**：回到起点：一个能拿奥数金牌线的系统，为什么会数错 strawberry 里的 r？走完这一路，你能自己解释了吗？
