尧图精选

NVIDIA GB200 NVL72深度拆解:铜缆背板如何把72颗GPU连成一台计算机

🕒 发布时间:2026/10/2 13:22:01 📁 来源:尧图网络
第一次在GTC现场看到 DGX GB200 NVL72 时我的第一反应是绕着机柜走了两圈。72颗 Blackwell GPU 被塞进一个标准尺寸机柜里还能让它们用 NVLink 直接互连这个想法在 H100 时代几乎没人敢立项。整柜不是“服务器堆叠”的草稿而是“机柜即计算机”的正式答卷。真正吸引我的并不只是 72 这个数字而是为了实现单机柜 72 GPU 组成的 NVLink 域NVIDIA 把整套交换网络做成了铜缆背板方案去掉光模块、去掉外部跳线、用背板把计算托盘和 NVSwitch 托盘焊在同一套物理框架里。这个选择背后涉及信号完整性、功耗、散热、布线和运维方式的一连串取舍拆起来相当有意思。这篇文章我不打算复述发布会 PPT而是用手把手拆解的方式从最基础的计算单元开始一路看到 NVLink Switch 铜缆背板是怎么把 72 颗 GPU 串成一个完整系统的。适合三类人看真要上 NVL72 的机房和基础设施工程师做 GPU 集群、大模型微调与算力调度的算法工程师以及纯粹想搞清楚“一个机柜为什么能塞下这么多 GPU”的好奇玩家。拆完之后你会发现这个机柜真正的难点不是 GPU 本身而是那个看不见的交换网络。1. 先给NVL72画个像72颗GPU是怎么被“塞”进去的拆任何系统前都要先建立地图。NVL72 机柜不是传统意义的“机架式服务器”更准确地说它是一个被做成机柜形态的分布式计算主机。从前到后计算资源、交换资源、供电和散热全部被整合在一个物理框体内。要理解 72 颗 GPU 是怎么被塞进去的要先理解它的基本架构从 8 卡时代到 72 卡时代发生了什么变化。1.1 从单机8卡到机柜级72卡底层思路变在哪过去几年大家熟悉的 DGX H100 是一台 8 卡机器8 颗 GPU 在一个 NVLink 域内可以直接高速交互出了这个域就必须走 InfiniBand 或以太网。也就是说在传统 AI 数据中心里“一台服务器”的算力边界是 8 颗 GPU。想要训练更大的模型只能把很多个 8 卡域通过网络拼在一起而网络通信的延迟和带宽远不如 NVLink 内部交互。NVL72 的思路完全不同。它不再把机柜当成若干个“8 卡服务器”的集合而是让整个机柜里的 72 颗 GPU 加入同一个 NVLink 域。这个变化不是把 9 套 8 卡机器叠在一起就能实现的因为多套 8 卡机器之间缺少一套统一的交换矩阵。NVL72 的做法是做了一整套 NVLink Switch 网络让每颗 GPU 都有独立的高速通道连到交换背板再由背板把所有 GPU 打成一片。你可以把 H100 时代理解成“一个小会议室里开小组会”出了会议室就只能靠打电话交流而 NVL72 是一个能装下 72 人的大厅每个人都有一根专线通到总机台总机台再按需把任何两个人接通。底层思路从“全网互通靠外部网络”变成了“机柜内部直接做成全对等互联网络”。1.2 GB200 Superchip拆解最基本的计算单元要拆 72 颗 GPU先看最小的计算单元。NVL72 的基础单元叫 GB200 Grace Blackwell Superchip每个超级芯片包含 1 颗 Grace CPU 和 2 颗 Blackwell GPU。GB200 内部不是简单用一个 PCIe 交换机把 CPU 和 GPU 连起来而是用 NVLink-C2C 做芯片级互连CPU 和 GPU 之间的数据搬运带宽比传统 PCIe 高一个数量级。NVL72 里一共有 36 个 GB200 超级芯片所以 GPU 总数是 36×272Grace CPU 总数是 36 颗。很多人第一次看到 NVL72 会误以为里面有 72 颗 CPU其实 CPU 只是每个超级芯片里的“管家”负责数据加载、控制和通信调度真正的算力主力全部压在 GPU 上。GPU 方面Blackwell 每颗都带 HBM3e 高带宽显存单颗显存 192GB显存带宽 8TB/s 级别。72 颗 GPU 加在一起仅 GPU 显存总量就达到 13.8TB 左右显存带宽总共 576TB/s 级别。这个容量意味着万亿参数级别的 MoE 模型可以整体放进一个机柜的显存里训练时不需要频繁把参数从外部存储搬到 GPU 上这是 NVL72 能大幅提升训练效率的一个根本原因。1.3 机柜内的物理布局托盘、背板和液冷说回物理形态。NVL72 机柜内部被划分成几个大区计算托盘区、NVLink Switch 托盘区、液冷分配区和供电区。计算托盘像抽屉一样从正面插入每个托盘承载 GB200 超级芯片NVLink Switch 托盘负责交换网络GPU 与交换机之间不通过外部光模块和线缆而是通过背板铜缆直接连接。我第一次拆开 NVL72 结构图时最直观的感受是“这机柜几乎没有传统意义上的网线”。从计算托盘到 NVSwitch 托盘的连接全部被背板承载。由于 72 颗 GPU 同时工作单机柜功耗在 120kW 级别这个量级风冷根本压不住所以机柜内部全部走液冷CPU、GPU、NVSwitch 芯片甚至部分供电模块都有冷板覆盖。简单说能塞得下 72 颗 GPU第一功臣是液冷而让它们高效协同第二功臣就是背板铜缆交换网络。2. NVLink Switch背板柜子里的“隐形骨血”前面说了 NVL72 是“机柜即计算机”那它的“总线”就是 NVLink Switch 背板。这一部分我建议重点看因为 72 颗 GPU 塞进一个机柜容易让 72 颗 GPU 互相通信不打架很难真正的技术含量全在交换背板设计上。2.1 为什么必须上NVLink SwitchMesh网络与全对等带宽如果不使用交换芯片想实现 72 颗 GPU 全互连理论上每颗 GPU 要给另外 71 颗 GPU 各拉一根点对点线总共要 2556 组链路。这根本不可能实现芯片引脚不够、PCB 走线空间不够信号完整性也会失控。所以 NVL72 采用了交换集中式拓扑。每颗 GPU 不是直接连到另外 71 颗 GPU而是连到一组 NVLink Switch 芯片由交换芯片负责转发。从 GPU 的角度看它只需要把 18 条 NVLink 端口全部接出去就能访问整个 NVLink 域里的其他 71 颗 GPU。这里的“全对等”指交换网络没有收敛比任何两颗 GPU 之间都能跑满 NVLink 带宽不会因为网络拥塞降速。这个设计和数据中心里的 Spine-Leaf 网络有相似之处但区别在于 NVL72 是单一厂商定制的固定拓扑。GPU 与 NVSwitch 的布线路径在设计阶段就已经固定不需要靠路由协议去动态发现路径所以能省掉大量控制开销延迟也被压得非常低。提示NVLink Switch 不只是交换数据它还能在网络里做部分聚合运算。像 AllReduce 这种集合通信数据可以在交换机端先合并一部分再往目标 GPU 传大幅减少流量。2.2 铜缆背板 vs 光模块NVL72为什么选铜任何一个做过高速互连的人看到 NVL72 的第一反应都会问为什么不用光毕竟 72 颗 GPU 的数据量如此之大光模块看起来才是“高端方案”。但拆开 NVL72 的物理设计答案非常直接距离太短用光纯属浪费。NVL72 机柜内部从计算托盘到 NVSwitch 托盘的链路长度也就是几十厘米到两米的范围。在这么短的距离内高速铜缆的衰减完全可控根本不需要光电转换。铜缆方案对比光模块有几大优势对比项铜缆背板方案光模块/AOC方案单端口成本低无需激光器和光电芯片高光模块本身成本高功耗低无源铜缆本身不耗电SerDes 直接驱动高光电转换需要额外功耗散热压力小不会在交换托盘附近产生额外热源大光模块密集时会成为局部热点可靠性无激光衰减和光口污染问题光口进灰、激光器老化都要考虑可维护性背板固定、插拔模块化故障面更少线缆、模块多故障点更多在数百米甚至跨机房场景下光模块依然是不可替代的方案但在 NVL72 这个封闭机柜内铜缆背板是性能和成本的平衡点。省掉光模块等于省掉了几百个热源和故障点这对一个功耗已经 120kW 级别的机柜来说意义极大。2.3 背板拓扑与信号完整性思路NVL72 的 NVLink Switch 背板从结构上有点类似高端交换机里的正交背板设计GPU 计算托盘从一侧插入NVSwitch 托盘从另一侧插入中间的背板充当物理层连接中枢。这样设计的好处是走线最短链路中的连接器数量最少因此信号损耗最小。高速信号最怕的就是“过好几道关”。每经过一个连接器、一个过孔、一段走线信号质量都会下降一点。NVL72 的背板设计思路是尽量减少中间环节让 GPU 的 SerDes 信号以最短路径到达 NVSwitch 芯片。这背后涉及阻抗控制、差分等长、背钻过孔、材料选型等一系列高频 PCB 设计工艺任何一个环节没做好链路都会在高速下出现误码。从拓扑上看每颗 GPU 向 18 个 NVSwitch 芯片各拉一条独立链路。于是 18 颗 NVSwitch 芯片和 72 颗 GPU 之间形成了类似“全连接”的交换关系。每个 NVSwitch 芯片需要面向 72 颗 GPU 提供端口而每颗 GPU 只需要面对 18 个 NVSwitch 芯片。这个拓扑结构看起来简单实际做背板时布线压力巨大因为 1296 条 GPU 侧端口要在有限尺寸的PCB上完成层数、走线密度、隔离间距每一步都是硬功夫。3. 核心细节拆解从端口到散热一颗螺丝也不能含糊到了这一部分开始进入真正“手把手拆解”的环节。我会把 NVL72 的核心参数、背板信号、散热供电三个方面拆开一个个说明白。3.1 72 GPU 单一NVLink域的端口账本先把端口账算清楚。Blackwell GPU 单颗拥有 18 条 NVLink 端口每条端口双向带宽 100GB/s 级别单颗 GPU 的 NVLink 聚合带宽约为 1.8TB/s。这个带宽如果换算成传统数据中心网络相当于同时使用 36 个 400Gbps 网口。换句话说NVL72 把数据中心的网络带宽直接搬到了单机柜内部而且延迟更低。我把 NVL72 的关键参数整理成了下面这个表方便对照项目数值GPU 数量72 颗 BlackwellCPU 数量36 颗 Grace基础计算单元数36 个 GB200 Superchip单颗 GPU NVLink 端口数18 条单颗 GPU 聚合 NVLink 带宽约 1.8TB/sNVSwitch 芯片数量18 颗全机柜 NVLink 聚合带宽约 130TB/sGPU 显存总量约 13.8TB HBM3e这组账本说明了两件事。第一72 颗 GPU 之间不存在传统以太网那种“多数流量跑不满”的设计顾虑训练大模型时张量并行、专家并行产生的通信流量全部可以在 NVLink 域内消化。第二整体带宽一旦达到 130TB/s软件层调度就必须小心否则随便一个低效 AllReduce 都可能浪费掉这个巨大的硬件优势。3.2 背板走线的关键工艺与信号完整性接下来看背板本身。很多人以为“铜缆背板就是把线布粗一点”实际上恰恰相反。NVLink 的单条高速信号频率非常高在这种速率下信号完整性已经不是一个“是否连通”的问题而是“信号能否保持完整到达”的问题。背板上每一段走线都像一根天线弯折、过孔、连接器、阻抗不连续都会让信号产生反射和串扰。NVL72 背板设计里最值得说的几个点低损耗板材普通 FR4 板材在高速率下损耗过大NVL72 这类背板必须使用低损耗高速板材才能保证信号在长距离走线后依然能被正确恢复。差分对等长NVLink 信号是差分信号正负两条走线必须保持等长否则会产生时序偏移。背板布线上会看到大量蛇形走线就是为了补偿长度差。背钻工艺高速信号过孔会产生 stub也就是一段没有用到的金属柱它会像天线一样干扰信号。背钻工艺就是把这段多余部分钻掉降低过孔带来的信号反射。连接器选型计算托盘与背板之间的连接器必须支持高速率同时还要满足热插拔需求。连接器的接触电阻、插入损耗、串扰指标直接决定链路质量。所以在拆解 NVL72 时别只看 GPU 规模真正要先看的是背板 PCB 的层数、连接器规格和走线密度。一台 NVL72 至少是几十层背板所有高速差分线必须精确规划否则 72 颗 GPU 的 NVLink 带宽会大打折扣。注意维护时尽量不要在 NVLink 链路上随意做“回环测试”或“短接”高速背板不是普通网线非标准工具很容易造成链路训练异常。3.3 液冷与供电让塞满的机柜不“炸”掉NVL72 的散热压力可以从功耗倒推。一个机柜 120kW 级别的功耗如果换算成传统风冷基本等于在一间小房间里同时开几百台高功率吹风机风冷根本排不掉。NVL72 采用的是全液冷冷板方案冷却液通过 CDU 进行二次侧分配经过冷板直接带走 GPU、CPU 和 NVSwitch 芯片的热量。液冷的价值不只是降温还直接影响性能稳定性。GPU 温度一旦过高会自动降频72 颗 GPU 一起降频整体算力损失会非常明显。液冷方案可以让芯片温度保持在更稳定的区间长时间训练时不会因为散热波动导致算力起伏。供电方面120kW 级别机柜对供电链路要求很高。传统 12V 供电在如此高的电流下会产生巨大损耗所以 NVL72 这类机柜级系统普遍向高压直流母线演进。供电链路中的铜排、母排、连接器都需要重新设计这也是为什么 NVL72 从外观上看比普通 GPU 服务器“粗壮”很多。你甚至可以这么理解NVL72 本质上是一个“带液冷的小型数据中心”只是它被压缩进了一个机柜的体积。4. 实操视角如果我在机房部署/维护NVL72该盯住哪些事拆完硬件必须回到实操。NVL72 不是买回来插上电就能用它对机房基础设施和运维方式的要求跟传统 GPU 服务器完全不同。我自己梳理了一份部署和维护时的关注清单踩过坑的人都懂。4.1 上架前的机房检查清单先看机房能不能“接住”它。很多团队第一步就败在供电和制冷评估上。NVL72 单机柜功耗 120kW 级别这已经不是普通机柜空调用电可以覆盖的必须提前做容量规划。检查项重点原因供电容量两路供电、每路功率余量单机柜功耗极高不能按普通 GPU 服务器估算液冷系统CDU 流量、二次侧水质、漏液检测冷板堵塞或流量不足会导致芯片高温降频机柜承重地板加固、机柜底座承重满载机柜重量远超常规架空地板可能直接压坏网络规划管理网络、存储网络独立规划GPU 域内通信不走外部交换机但控制面仍需网络搬运路径机柜进入机房的路由、电梯承重带液冷的机柜重量大运输路线必须先走一遍尤其要注意液冷系统的管路设计。NVL72 的液冷不只是给 GPU 散热还包括交换芯片和部分供电模块。如果 CDU 二次侧流量分配不均可能会出现“GPU 温度正常但 NVSwitch 温度偏高”的怪现象。上架前最好把液冷设备和水质测试做完不要等机器跑起来才发现管路压降不对。4.2 铜缆背板维护中的常见坑NVL72 的背板铜缆是固定式或半固定式设计不像普通数据中心那样随意拔插网线。维护时最常见的问题恰恰是“手痒”有人觉得某个链路不稳定反复插拔计算托盘或交换托盘结果把背板连接器弄出接触不良。实际操作中的几个心得插拔计算托盘时一定要先断电等供电电容放完。NVLink 链路带电插拔的风险比普通 PCIe 设备高很多容易损伤连接器。背板连接器上的防尘盖只有在模块到位前最后一刻才能取下。高速连接器进灰后轻则链路误码率升高重则 NVLink 训练失败。更换 NVSwitch 托盘后不要急着进系统跑应用先检查 NVLink 链路状态。很多链路问题并不是芯片坏了而是连接器没有完全插到位。另外NVL72 这种系统对固件版本非常敏感。NVSwitch 托盘固件、GPU 驱动、CUDA 版本三者需要匹配。曾经有团队升级了 GPU 驱动但没升级 NVSwitch 固件结果部分 NVLink 链路训练失败查了半天才发现是版本不匹配。4.3 监控与故障排查建议上架稳定运行后我最建议做的第一件事不是直接跑大模型而是先做一次完整的链路压测。很多人喜欢跑 gpu-burn但 gpu-burn 只能验证 GPU 核心算力验证不了 NVLink 背板。要验证 72 颗 GPU 之间的交换网络需要跑 NCCL 的带宽测试或者集合通信压测。可以先执行下面这些命令确认基础状态nvidia-smi topo -m nvidia-smi nvlink -s # 再用NCCL测试工具跑一遍allreduce和allgather带宽如果在测试中发现某颗 GPU 到其他 GPU 的带宽明显偏低多半不是算力问题而是 NVLink 链路降速或重传过多。排查思路是先看链路状态再看物理连接最后再看温度和固件日志。还有一个很隐蔽的问题GPU 和 CPU 占用都不高但任务就是卡顿。很多情况下问题不在计算资源而在通信链路。NVL72 里 72 颗 GPU 频繁做集合通信一旦某条 NVLink 链路因为信号质量差进入降速模式整个训练任务都会出现周期性的等待。这种问题用 top 看 CPU、GPU 占用率根本看不出来得看 NVLink 链路的错误计数和重传统计。5. 从NVL72回头看数据中心该怎么重新理解拆完一台 NVL72再回头看整个 AI 数据中心会发现很多东西都被改变了。单机柜不再是简单的算力单元而是重新定义了“一台计算机”的边界。5.1 对现有机房基础设施的冲击最直接的冲击是供电和散热。NVL72 把过去需要半个机柜的网络设备省掉了把交换能力压进了背板但同时把单位面积的功耗推到了新高度。传统数据中心机柜设计一般按 8kW 到 15kW 规划遇到 NVL72 就需要特殊机柜位甚至需要单独改造区域。更现实的是很多机房风冷时代预留的管路和供电完全无法支撑 NVL72。上架前不重新做电力规划和液冷改造系统根本跑不起来。这也意味着 AI 基础设施运维团队的工作内容变化很大以前主要管服务器网络现在还要懂背板拓扑、液冷循环和高压直流供电这对团队技能栈提出了新要求。5.2 铜缆方案的边界与未来NVL72 选铜缆背板是基于“单机柜封闭拓扑”这个前提。如果未来要更大规模地扩展比如把几个 NVL72 机柜连成一个几百 GPU 的超大 NVLink 域跨机柜距离明显变长铜缆就会力不从心光互连仍然是必经之路。但我想强调的是NVL72 的铜缆背板给行业提供了一个重要思路能不放光模块的地方就不放光模块。光模块虽然带宽高但成本和功耗都不低。只要距离可控无源铜缆就是更经济、更可靠的选择。未来即便出现更大规模的 NVL576大概率也是机柜内部继续用铜机柜之间才引入光。这种“混合互连”会成为大型 AI 系统的主流设计。5.3 值得复用的设计思想从 NVL72 里最值得学到的不是某个独家黑科技而是一条设计原则尽量让数据留在离计算最近的地方。过去做大规模训练大家都默认网络是瓶颈于是堆 InfiniBand、堆网卡NVL72 从系统层面重新划分了“计算边界”把内部通信用背板交换解决外部只保留必要的控制、存储和跨机柜通信。这个思想完全可以移植到其他领域先在系统内部把带宽做足再谈外部扩展。我个人在实际操作中的体会是面对 NVL72 这种系统不要再用“显卡服务器”的思维去理解和运维。它更像一个封闭的高性能计算节点只是把网络和供电都内化了。调试时多关注 NVLink 链路状态维护时管好液冷和供电部署时提前把机房基础设施升级到位这套设备才能真正发挥出 72 颗 GPU 该有的效率。最后再分享一个小技巧任何一次硬件变更后都先跑一遍完整的 NVLink 带宽测试再进入正式训练别省这一步。
上一篇/下一篇内容由系统自动关联 返回资讯列表 →