# 第 13 章 建厂图纸：NVIDIA 企业参考架构

> 本章问题：一座企业 AI 工厂该怎样配置、怎样扩展、怎样验证？
> 来源：https://llm.weiborao.link/#ch13

**上一章留下的问题：**定义和原则有了。可是真要动手建，第一台服务器该怎么配、几台算一个单元、网络怎么连、存储要多快？有没有一份现成的“建厂图纸”？

有。NVIDIA 为企业 AI 工厂发布了一套**参考架构**（Reference Architecture，简称 RA；面向企业的这一套常称 Enterprise RA）。本章不急着看具体型号，而是先学会“读图纸”：它为什么存在、分几层、用什么代号、按什么单元扩展、网络怎样分工。学会这套语言，第 14 章拆开一份真实的图纸时，每个数字都会有来处。

### 13.1 为什么需要图纸

第 12 章的白皮书说，企业 AI 工厂难在“每个决定都牵动其他决定”。参考架构的作用，就是把这些反复出现的决定提前做好、测好。白皮书写道：

> 这些参考架构建立在 NVIDIA 数十年加速计算经验之上，包括从超大规模云、超级计算、企业 AI 部署以及 NVIDIA 自己的 AI 工厂中学到的教训。……小的基础设施选择在规模化时可能变成大问题，比如线缆和光模块的选择会影响散热、交付周期和客户体验。系统平衡同样重要：CPU、GPU、存储和网络的配比，在几个节点或单一负载时看起来没问题，但不平衡的设计会在集群扩展时限制分布式推理、降低利用率或造成运维瓶颈。
>
> —— NVIDIA 企业参考架构白皮书（本书译）

类比：

参考架构像建筑行业的**标准图集**加**预制装配式构件**。你不必为每栋楼重新计算梁柱，而是从经过验证的户型和构件里选；施工队（合作伙伴）照图集施工，监理（设计评审）按图集验收。图集不替你决定盖几层、住几户，但能保证照着盖不会塌。

### 13.2 三个层级，四步上市

> 【图示】NVIDIA 参考架构体系：三个层级——NVIDIA 认证系统定义单台服务器，参考架构定义服务器怎样组成集群，软件参考设计与验证设计定义在上面跑什么；以及四步上市流程——自研验证、形成文档、设计评审委员会背书、由合作伙伴规模化交付。

**图 13-1** NVIDIA 参考架构的体系。认证系统管“一台服务器”，参考架构管“怎样组成集群”，软件参考设计管“上面跑什么”；合作伙伴的设计经过设计评审委员会（DRB）背书后公开发布。

白皮书把参考架构的上市过程概括为四步：**自研**（NVIDIA 先用 DGX 系统和自家 AI 工厂的经验验证系统、集群和软件的部署模式）、**成文**（写成三个层级的文档）、**背书**和**规模化**。其中“背书”这一步最值得企业留意：合作伙伴（服务器厂商）用 NVIDIA 认证节点和 RA 模式设计自己的集群方案，交给由 NVIDIA 工程师主导的**设计评审委员会**（Design Review Board，DRB）审查；通过的方案会公开在 NVIDIA 网站上，客户可以查到它用的是哪种配置、支持多大规模、拿到了哪些类别的背书。

表 13-1 设计评审委员会的背书类别

| 背书类别 | 要求 | 含义 |
| --- | --- | --- |
| 基础设施配置 | 必需（基线） | 系统与集群设计遵循对应的 RA 基础设施模式 |
| Spectrum-X 兼容 | 推荐（附加） | 东西向网络设计符合 AI 东西向网络的要求 |
| 网络逻辑架构 | 推荐（附加） | 南北向与东西向网络在对应规模下的逻辑拓扑经过审查 |

另据 NVIDIA 参考架构文档页，背书的最低条件包括：节点通过对应参考配置的 NVIDIA 认证；网络设计与拓扑符合 RA 设计点；服务器物料清单经 NVIDIA 审核；最大规模下的集群物料清单经 NVIDIA 审核。

### 13.3 读懂代号：C-G-N-B

翻开任何一份企业参考架构，最先看到的是一串像“2-8-9-800”的数字。它叫**参考配置**（reference configuration），描述一台服务器（节点）的“形状”。白皮书的定义是：四个字段依次表示**CPU 插槽数、GPU 数、网卡数、每块 GPU 的平均东西向网络带宽**（Gb/s）。

> 【图示】读懂参考配置代号 C-G-N-B：以 2-8-9-800 为例，2 表示每台服务器 2 个 CPU 插槽，8 表示 8 块 GPU，9 表示 9 块网卡（8 块东西向、1 块南北向），800 表示每块 GPU 平均 800 Gb/s 的东西向带宽。

**图 13-2** “2-8-9-800”的读法。一串数字就把节点的计算力、网卡配置和东西向带宽说清楚了，也让不同厂商的服务器可以在同一把尺子上比较。

表 13-2 常见参考配置（节选）

| 代号 | 家族 | 网卡构成 | 东西向带宽 / GPU | 典型 GPU |
| --- | --- | --- | --- | --- |
| 2-8-5-200 | RTX PRO | 1 南北向 + 4 东西向 | 200 Gb/s | RTX PRO 6000 / 4500 Blackwell 服务器版 |
| 2-4-3-200 | RTX PRO | 1 南北向 + 2 东西向 | 200 Gb/s | 同上 |
| 2-X-1-NA | RTX PRO | 仅 1 南北向 | 不适用 | 同上（每台 2、4 或 8 块） |
| 2-8-9-400 | HGX | 1 南北向 + 8 东西向 | 400 Gb/s | HGX H100 / H200 / B200 |
| 2-8-9-800 | HGX | 1 南北向 + 8 东西向 | 800 Gb/s | HGX B300 |
| 2-4-5-800 | NVL72（每个托盘） | 1 南北向 + 4 东西向 | 800 Gb/s | GB300 NVL72 |

来源：NVIDIA 企业参考架构白皮书表 2 与 HGX H100/H200/B200 参考架构。白皮书注明这只是部分配置的示例。

**停一下：HGX 节点为什么是“9 块网卡”，而不是 1 块大带宽网卡？**

**参考答案：**

因为 8 块 GPU 各配 1 块东西向网卡，正好 1:1，再加 1 块负责南北向的 DPU。1:1 的好处是：每块 GPU 通过自己附近的 PCIe 通道直接连到“自己的”网卡，用 GPUDirect RDMA 直接收发，不必和其他 GPU 抢一条路；同时每块网卡接到一条独立的“轨道”上（第 14 章）。HGX 参考架构的原话是：推荐合作伙伴按 1:1 的 GPU 与网卡比例来配置。

### 13.4 三个家族：按机房条件和负载来选

白皮书把企业 AI 工厂分成三个家族。它们不是“好、更好、最好”，而是对应不同的机房条件和负载。

表 13-3 企业 AI 工厂的三个家族

|  | RTX PRO AI 工厂 | HGX AI 工厂 | NVL72 AI 工厂 |
| --- | --- | --- | --- |
| 基础 | RTX PRO 服务器（PCIe GPU） | 8 卡 HGX 服务器（当前一代为 HGX B300） | GB300 NVL72 机柜 |
| 机房条件 | 风冷、PCIe，适合空间、电力、散热受限的机房 | 高密度，风冷版本可用（H100/H200/B200 参考架构即为风冷外形） | 机柜级供电与先进散热是前提 |
| 擅长 | 生成式与 Agent 推理、视觉计算、数字孪生、数据分析 | 大模型训练与微调、大规模分布式推理、HPC | 万亿参数训练、超大混合专家模型、大规模实时推理 |
| 可扩展单元 | 4 台 | 4 台 | 1 个机柜（18 个托盘） |
| 规模范围 | 4–32 台，最多 256 GPU | 4–128 台，最多 1,024 GPU | 1–8 柜，72–576 GPU |
| 厂商口径的性能 | — | HGX B300 的 Token 吞吐量是 HGX H100 的 15 倍 | “AI 工厂产出”提升 50 倍 |

“15 倍”“50 倍”为 NVIDIA 白皮书原文中的厂商口径，比较条件以 NVIDIA 原始资料为准。

白皮书强调：实际部署可以组合多个家族，用不同配置承载不同负载。比如用 RTX PRO 承担大量单卡推理和视觉任务，用 HGX 承担微调和多机推理。选择的第一道门槛往往不是预算，而是第 12 章说的**每柜千瓦数和有没有液冷**。

上面是白皮书的概览。三个家族各有一份独立的参考架构文档，下面逐一打开，看它们在节点、网络、散热和适用负载上的具体差别。

> 【图示】三个家族的一个可扩展单元对比。RTX PRO：4 台 8 卡 PCIe 服务器，每台 4 块 400G SuperNIC，两块 GPU 共享一块，平均每 GPU 200 Gb/s，风冷。HGX B300：4 台 8 卡服务器，GPU 经 NVLink 全互联，每块 GPU 一块 800G SuperNIC，风冷。NVL72：一个液冷机柜，18 个托盘共 72 块 GPU 组成一个 NVLink 域，每块 GPU 800G 东西向，整柜最高 142 kW。

**图 13-3** 三个家族的一个可扩展单元。RTX PRO 和 HGX 都是“4 台 8 卡服务器”，差别在 GPU 之间怎么连、每块 GPU 配多少网络带宽；NVL72 则把 72 块 GPU 装进一个液冷机柜，用 NVLink 连成一个整体。

#### RTX PRO AI 工厂：2-8-5-200，给“现有机房”的方案

它的参考架构以 NVIDIA 认证的 RTX PRO 服务器为节点，每台 8 块 **RTX PRO 6000 Blackwell 服务器版** GPU。这是一块 PCIe 卡：每块 96 GB GDDR7 显存、最高 1.6 TB/s 带宽，8 卡合计 768 GB。文档的定位很明确：适合“需要风冷、高能效平台的企业数据中心”。

- **网卡是 2:1**：每台只有 4 块 400G 东西向 SuperNIC，两块 GPU 共享一块，所以平均每块 GPU 200 Gb/s，这就是代号里的“5”和“200”。文档建议合作伙伴按“最多 2:1”的 GPU 与网卡比例来配；如果做微调、图像和视频生成这类更吃东西向带宽的负载，建议提高到每 GPU 400 Gb/s。
- **CPU 和内存按 GPU 数来算**：每块 GPU 至少 7 个 CPU 物理核（用 MIG 切分时每个实例另需 2 核，跑 Spark 数据处理每 GPU 再加 1 核），每块 GPU 至少 128 GB 系统内存。
- **规模与网络**：设计点是 16 台（128 GPU）和 32 台（256 GPU）。16 台时，东西向和南北向合并成一张“压缩的叶脊网”以降低成本；超过 4 个单元后，东西向改为独立网络。一个单元的东西向接入是 4 台 × 4 × 400G = 16 个端口，共 6.4 Tb/s，是 HGX 单元的一半。
- **适合的负载**：Agent 推理（中小模型）、工业与物理 AI（数字孪生、视频分析、合成数据）、视觉计算与渲染、FP32 及以下精度的仿真与数据分析，以及虚拟工作站。

#### HGX AI 工厂：2-8-9-800，给“AI 重度用户”的方案

当前一代的 HGX 参考架构基于 **HGX B300**：每台 8 块 Blackwell Ultra GPU，每块 288 GB HBM3e，8 卡合计约 2.3 TB；机内第五代 NVLink 的总带宽 14.4 TB/s。它仍然是风冷外形。与第 14 章要拆的 H100/H200/B200 版相比，有三处关键变化：

- **网卡上了基板**：8 块 ConnectX-8 SuperNIC 直接集成在 HGX B300 基板上，仍保持 GPU 与网卡 1:1，每块 GPU 对外 800 Gb/s（2 × 400G）。
- **南北向升级**：推荐用 400G 的 BlueField-3 B3240 替代 B200 及以前常见的 2 × 200G 的 B3220。文档给出的理由很有前瞻性：未来的分布式推理可能把 KV 缓存卸载到高速网络存储上（第 6 章讲过 KV 缓存有多占显存），这时每块 GPU 需要更高的突发 I/O 能力。
- **双平面成为推荐**：每块 GPU 的 800G 拆成两个 400G 口，分别接到两张完全独立的东西向网络（13.5 节详述）；也支持只用一个 400G 口的单平面，作为降低网络成本的选项。这正是第 14 章 Cisco 方案表里“2-8-9-800 与 2-8-9-400”并列的原因：前者是双平面，后者是单平面。

文档说，B300 单块 GPU 大约能装下 1200 亿参数的模型，更大的模型仍可在一台服务器内用 NVLink 做模型并行，所以纯推理同样可以不建东西向计算网。

#### NVL72 AI 工厂：2-4-5-800，“一柜即一机”

NVL72 的参考架构基于 **GB300 NVL72**。它的基本单位不是服务器，而是一个机柜：

- **18 个计算托盘**，每个托盘 2 颗 Grace CPU（共 72 个 Arm 核、1 TB LPDDR5 内存）和 4 块 Blackwell Ultra GPU；一柜共 36 颗 CPU、72 块 GPU。每个托盘带 4 块 ConnectX-8 做东西向（与 GPU 1:1，每块 800 Gb/s）、1 块 BlueField-3 B3240 做南北向。
- **9 个 NVLink 交换托盘**，每个装 2 颗 NVSwitch 芯片。每块 GPU 有 18 条第五代 NVLink，经铜背板分别接到柜内每一颗 NVSwitch，于是 72 块 GPU 组成一个全互联的 NVLink 域，总带宽 130 TB/s。文档的说法是：这让 72 块 GPU 可以“作为一个多 GPU 计算单元”工作。NVIDIA 官网列出整柜“高速内存”37 TB，它是 20 TB GPU 显存与 17 TB CPU 内存（LPDDR5X）之和，两者速度差别很大，不宜理解为同质的一整块内存。
- **电力与散热**：液冷；8 个 33 kW 的电源架；**整柜最高约 142 kW**；托盘级和机柜级都有漏液检测。对照第 12 章白皮书说的“许多机柜仍低于 20 kW”，这道门槛的高度一目了然。
- **规模**：1 柜起步，按柜扩展，经过完整测试的规模是 8 柜（576 GPU）；东西向始终是双平面。管理面假设 12 台控制节点，并“强烈建议”用 NVIDIA Mission Control 来运营。

文档还给了一个直观的尺度：按 FP4 量化，超过约 1.92 万亿参数的模型，才需要跨出**单个托盘**（4 块 GPU），借助柜内的 NVLink 和 NVSwitch 做模型并行。粗算一下就能理解：1.92 万亿参数 × 每参数 0.5 字节 ≈ 960 GB，正好放得进一个托盘约 1.15 TB 的显存。作为对比，H100/H200/B200 版参考架构给出的单卡上限约 130 亿参数；两份文档的口径、精度和计量单位（单卡与单托盘）都不同，只能看量级。

表 13-4 三份参考架构的关键参数对照

|  | RTX PRO | HGX B300 | GB300 NVL72 |
| --- | --- | --- | --- |
| 节点代号 | 2-8-5-200 | 2-8-9-800 | 2-4-5-800（每托盘） |
| GPU / 节点 | 8 × RTX PRO 6000（PCIe） | 8 × B300（SXM） | 4 × Blackwell Ultra |
| 每 GPU 显存 | 96 GB GDDR7 | 288 GB HBM3e | 最高 288 GB |
| GPU 之间 | PCIe | 机内 NVLink，14.4 TB/s | 整柜 NVLink 域，130 TB/s |
| 东西向网卡 | 4 × 400G（2 GPU 共享 1 块） | 8 × ConnectX-8（1:1） | 4 × ConnectX-8（1:1） |
| 南北向 | BlueField-3 B3220（2 × 200G） | BlueField-3 B3240（400G） | BlueField-3 B3240（400G） |
| 一个单元的东西向带宽 | 6.4 Tb/s（4 台） | 25.6 Tb/s（4 台，双平面） | 57.6 Tb/s（1 柜） |
| 文档给出的模型规模上限 | 单卡约 400 亿（FP16）；另一处写约 700 亿 | 单卡约 1200 亿 | 单托盘（4 卡）约 1.92 万亿（FP4） |
| 散热 | 风冷 | 风冷 | 液冷，整柜最高约 142 kW |
| 测试规模 | 16、32 台 | 32、64、128 台 | 1–8 柜 |

来源：NVIDIA RTX PRO AI Factory、HGX AI Factory（B300）、NVL72 AI Factory 三份企业参考架构。“一个单元的东西向带宽”由文档给出的网卡数与速率相乘得到（本书计算）。RTX PRO 文档对单 GPU 模型上限有两处写法，大致分别对应 FP16 与 8 位精度；NVL72 文档对托盘显存也有两处写法（4 卡合计 1,152 GB 与 720 GB），本表取与 Blackwell Ultra 规格一致的前者。

**停一下：一家机房每柜只能供 15 kW、没有液冷的企业，想做大量 Agent 推理和少量微调，应该看哪个家族？**

**参考答案：**

先看 RTX PRO：PCIe、风冷，Agent 推理正是它的主场；如果微调对东西向带宽要求更高，可以按文档建议把每 GPU 带宽从 200 提到 400 Gb/s。HGX 也是风冷外形，但一台 8 卡 HGX 服务器的功耗远高于 PCIe 服务器，每柜能放几台要按实际供电来算（参考架构的原话是“每柜服务器数量取决于可用的机柜功率”）。NVL72 需要液冷和每柜一百多千瓦，这家企业的机房目前上不了。当然，具体选型还要用自己的负载做容量测算。

### 13.5 可扩展单元：工厂按“块”长大

参考架构里最重要的一个概念，叫**可扩展单元**（Scalable Unit，SU）。白皮书专门强调：

> SU 不是随意的节点数量。它是一个增量单位，集群拓扑、东西向网络、电力、散热、机柜布局和部署规划都围绕它来组织。
>
> —— NVIDIA 企业参考架构白皮书（本书译）

> 【图示】HGX AI 工厂的扩展路径：最小 1 个可扩展单元，即 4 台服务器、32 块 GPU；每次加 4 台。规模小时南北向和东西向可以共用一张网；到 16 台时建议拆成独立的南北向和东西向网络；独立后东西向可选单平面或双平面；更大规模采用叶脊架构，最大 32 个单元、128 台、1024 块 GPU。

**图 13-4** HGX AI 工厂的扩展路径（横轴按 2 倍刻度）。最小 1 个 SU（4 台、32 GPU），每次加 4 台，最大 32 个 SU（128 台、1,024 GPU）。规模越大，网络越专门化。

扩展时，网络拓扑会跟着“换挡”：

- **小规模**：南北向和东西向可以合并在同一张物理网上（RTX PRO 家族最多到 16 台都可以合并）。
- **16 台起**：HGX 参考架构建议拆成独立的南北向网和东西向网，让 GPU 计算流量与客户、存储、管理流量各走各的路。
- **拆开之后**：东西向网可选**单平面**（部署简单）或**双平面**（更高的韧性和路径多样性）。
- **大规模**：南北向和东西向都采用叶脊（spine-leaf）结构；NVL72 则始终使用独立网络和双平面东西向网，不提供合并或单平面选项。

**双平面是怎么回事？**B300 和 NVL72 的参考架构解释得很清楚：每块 GPU 的 800G 网卡口被拆成两个 400G 口，分别接到两台属于**两张完全独立网络**的叶交换机上。GPU 并不知道有两张网，它只看到自己的网卡把 100% 的流量送了出去；每张网各承担一半，跟踪、负载均衡和故障切换由 SuperNIC 在硬件上完成，NCCL 也参与两个平面之间的均衡。一张网坏了，流量自动走另一张，性能按损失的带宽线性下降，而不是整体中断。文档特别指出，这种由端点负责的均衡比链路聚合（LAG）或静态哈希更适合 AI 流量，原因正是第 11 章讲过的“熵低”。双平面的另一个好处是：每个口的速率减半、口数翻倍，同样的交换机能接更多端点，网络可以少一层。

类比：

这像城市道路的演进：小镇上，货车和私家车走同一条街没问题；城市变大后，就得修专门的货运通道（东西向）和客运干道（南北向）；再大，货运通道还要修成双向分离、互为备份的两套（双平面）。

### 13.6 网络：五类流量，各有通道

第 11 章讲过三张网。参考架构把流量分得更细，按用途分成五类：

> 【图示】参考架构里一台 HGX 服务器的五类流量与每块 GPU 的带宽配额（2-8-9-400，32 节点设计）：东西向计算网每块 GPU 400 Gb/s；面向客户网络至少 25 Gb/s；存储至少 12.5 Gb/s；另有管理与支撑服务网络，以及 1 Gb/s 的带外管理网。

**图 13-5** 一台 HGX 服务器的五类流量与每块 GPU 的带宽配额（数字来自 HGX H100/H200/B200 参考架构的 32 节点设计）。东西向、客户、存储三者之比约为 32 : 2 : 1。

1. **东西向（计算）**：节点之间 GPU 与 GPU 的流量，分布式训练、微调和分布式推理的命脉，要高带宽、低延迟，并随 GPU 数量同步扩展。
2. **存储**：数据摄取、检索、检查点和结果输出的数据通路，要按负载来配，不能让数据搬运拖累 GPU 利用率。
3. **客户上行**：把 AI 工厂接到企业的应用、用户和上下游系统，按推理流量、数据流和安全边界来设计。
4. **管理与支撑服务**：部署、监控、编排和生命周期管理，要和高性能数据通路分开，以免计算流量增长时运维受影响。
5. **带外管理**：服务器、网卡和交换机的管理口，物理上与用户隔离。

目前的企业参考架构基于以太网：Spectrum-X 以太网平台、Spectrum 交换机、ConnectX SuperNIC 和 BlueField-3 DPU；白皮书说未来也可能加入 Quantum InfiniBand 选项。南北向推荐使用 **BlueField-3 DPU**——一种自带 Arm 处理器的网卡，可以把安全（零信任、微隔离、防火墙）、存储加速和基础设施管理从主机 CPU 上卸载下来，并且独立于主机运行。

### 13.7 存储、软件与服务

**存储。**白皮书把数据称为“AI 工厂的燃料”，它要贯穿从建模、训练、微调到推理的每个阶段，而每个阶段的存储需求都不同。参考架构为存储预留了专门的网络接入点，并通过 **NVIDIA 认证存储**计划验证合作伙伴的存储系统：不仅测峰值性能，还测不同负载模式、压力下的表现，以及与认证服务器、NVIDIA 网络和日常运维方式的配合。HGX H100/H200/B200 参考架构给出的经验值是**每块 GPU 约 12.5 Gb/s 的存储带宽**，随集群线性增长，例如 16 块 GPU 约需 200 Gb/s 的总存储带宽。

**注意：是 12.5 Gb/s（比特），不是 12.5 GB/s（字节）**　这个数字很容易被看成字节，因为存储厂商习惯用 GB/s 报吞吐。可以用三处原文交叉验证它是比特：第一，文档的例子“16 块 GPU 约需 200 Gb/s”，16 × 12.5 = 200，单位是 Gb/s；第二，32 节点设计为 256 块 GPU 配了 32 条 100G 存储链路，32 × 100 Gb/s ÷ 256 = 12.5 Gb/s；第三，每台服务器的南北向只有两个 200G 口，文档写存储吞吐“每节点最高约 40 GB/s”，如果每块 GPU 要 12.5 GB/s，8 块就是 100 GB/s，物理上接不进来。换算成字节，**每块 GPU 约 1.56 GB/s，每台 8 卡服务器约 12.5 GB/s**——“12.5 GB/s”这个数字确实存在，但它是每台服务器，不是每块 GPU。还要记住，这是参考架构为存储网络预留的**基线配额**，不是存储系统的性能上限；需要频繁写检查点或做 KV 缓存卸载的场景，可能要更高（B300 参考架构就以“未来的 KV 缓存卸载需要更高突发 I/O”为理由，推荐把南北向 DPU 升级到 400G）。

**软件。**参考架构配有部署软件栈的配套指南，把裸机集群接到编排、NVIDIA AI Enterprise 软件、可观测性、负载容量规划和运维实践上。主要组件包括：

- **编排**：支持 Kubernetes 和 Slurm；HGX 参考架构明确说“Kubernetes 是现代企业 AI 工作的基础”，整套设计按部署 Kubernetes 及其上的应用来构建。
- **NVIDIA AI Enterprise**：按每 GPU 订阅的企业软件套件，包含 AI 开发所需的微服务、框架和库，以及 GPU 编排与基础设施管理。
- **Run:ai**：按策略动态分配 GPU，把一块卡切给多个推理模型共享，提高利用率（第 10 章）。
- **Base Command Manager**：裸机集群的部署与管理工具；**NetQ**：实时观察、排查和验证网络；**可观测性指南**：用 Prometheus、Grafana 等开源工具监控 GPU、网络和应用。
- **上层参考设计**：企业 RAG 部署与容量规划指南、AI-Q 研究型 Agent 蓝图、安全的 Agent 工作空间、机密计算部署等。

**服务。**参考架构文档还单列了服务：路线图规划、首个项目实施、托管运维、技术支持和培训。图纸画得再好，也需要有人施工、验收和长期运维。

### 13.8 图纸的边界

##### 企业参考架构适合

- 本地或混合部署的单租户企业集群，32 到 1,024 块 GPU
- 微调、RAG、推理、模型训练和小规模 HPC 的混合负载
- 希望用经过验证、可支持、可复制的方式起步并按块扩展

##### 它不负责

- 替你决定工作负载与规模（那是第 12 章的“第一个问题”）
- 多租户云服务商或万卡以上的前沿训练（另有面向云合作伙伴的参考架构，企业版正是由它“按企业规模裁剪”而来）
- 保证厂商口径的性能在你的业务上原样复现

白皮书总结参考架构的价值时，列了业务和 IT 两组收益：更快的见效时间、更高的资源与成本效率（“改善 Token 经济”）、更低的风险；性能、可支持性、可扩展与可管理性、更低的复杂度与总拥有成本。归根到底一句话：**把从零设计变成从已验证的模式出发**。

##### 本章带走

企业参考架构是 AI 工厂的“标准图集”：认证节点 + 集群设计 + 软件设计三层，经设计评审委员会背书后由合作伙伴交付。

- C-G-N-B 代号：CPU 插槽-GPU 数-网卡数-每 GPU 东西向带宽，如 2-8-9-800。
- 三个家族：RTX PRO（PCIe、风冷、推理与视觉）、HGX（8 卡高密度、训练与分布式推理）、NVL72（机柜级、前沿规模）。
- 可扩展单元：RTX PRO 与 HGX 为 4 台，NVL72 为 1 柜；规模越大，网络从合并走向独立、单平面走向双平面。
- 五类流量分通道；存储按每 GPU 约 12.5 Gb/s 起步；软件以 Kubernetes、AI Enterprise、Run:ai 为核心。

**于是，下一个问题**：学会了读图纸，就拿一份真实的图纸来拆：一座 HGX AI 工厂，从一台服务器、一个 4 台的单元，到 128 台、1,024 块 GPU，每一根线、每一台交换机是怎样安排的？
