热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >构建 10 万卡 GPU 集群的技术挑战

构建 10 万卡 GPU 集群的技术挑战

来源:互联网 更新时间:2026-08-12 15:54

自GPT-4发布以来,不少人觉得AI能力踩了刹车。这话不假,但真正的原因并非算法撞墙,而是没人敢为更大规模的单模型训练砸下足够的计算资源。目前已发布的模型,训练计算量大多卡在GPT-4的水平(约2e25 FLOP),即便Google的Gemini Ultra、Nvidia的Nemotron 340B和Meta的LLAMA 3 405B这些旗舰模型,FLOPs甚至更高,却因架构缺陷没能解锁新能力。

OpenAI拿到的算力更多,但主要用来训练那些更小、更便宜、过度训练的推理模型(比如GPT-4 Turbo和GPT-4o)。他们自己也承认,直到最近才开始训练下一代模型。接下来明摆着的一步,是训练一个万亿参数级别的多模态Transformer,吃进海量的视频、图像、音频和文本。这个任务还没人完成,但抢第一的竞赛已经白热化。

多个大型AI实验室——包括OpenAI/Microsoft、xAI和Meta——正在竞相搭建超过10万块GPU的集群。单集群的服务器资本支出就超过40亿美元,而且因为GPU需要共址实现高速芯片互联,数据中心容量和电力成了硬约束。一个10万GPU集群需要超过150MW的数据中心容量,一年耗电1.59太瓦时,按标准电价$0.078/kWh计算,电费就达1.239亿美元。

今天我们就来深入拆解这类大型训练集群背后的基础设施。光砸钱远远不够,高利用率才是真正的硬骨头——各种组件的故障率让人头疼,尤其是网络。我们会覆盖电力挑战、可靠性、检查点、网络拓扑选型、并行方案、机架布局以及整个系统的物料清单。一年前我们报道过Nvidia的InfiniBand问题,导致部分公司转向Spectrum-X以太网,而今天还要讲讲Spectrum-X的主要短板——这又让超大规模用户倒向了Broadcom的Tomahawk 5。

先算笔账:OpenAI训练GPT-4用了约2万个A100,持续90到100天,BF16 FLOPs约2.15e25。那个集群的峰值吞吐量是6.28 BF16 ExaFLOP/秒。换成10万H100集群,峰值飙升到198/99 FP8/FP16 ExaFLOP/秒,理论峰值比2万A100集群高出31.5倍。

在H100上,实验室在万亿参数训练中能达到35%的FP8模型FLOPs利用率(MFU)和40%的FP16 MFU。MFU考虑的是开销和瓶颈(功率、通信、重计算、延迟、低效内核等)后的有效吞吐。用FP8的话,10万H100集群只需4天就能重训一遍GPT-4。连续跑100天,大约能产出6e26有效FP8模型FLOP。但请注意:硬件的低可靠性会显著拉低MFU。

电力挑战

10万H100集群所需的关键IT功率大约150MW。GPU本身700W,但每台H100服务器里,CPU、网卡、电源等每个GPU还要额外消耗约575W。再加上存储服务器、网络交换机、CPU节点、光学收发器这些,总共还要多出10%的IT电力。对比一下,美国最大的国家实验室超算El Capitan只需30MW关键IT功率——政府的超算在行业面前根本不够看。

目前没有任何一栋数据中心建筑能塞下150MW的新部署。大家说的10万GPU集群,指的是同一个园区内,而不是同一栋楼。没别的办法,X.AI甚至在田纳西州孟菲斯改造旧工厂来满足电力需求。

网络连接依赖光学收发器,成本与覆盖范围成正比。长距离“单模”DR和FR收发器能可靠传到500米到2公里,但成本是支持50米以内的“多模”SR和AOC收发器的2.5倍。而园区级“相干”800G收发器范围超过2公里,成本是多模的10倍以上。

小型H100集群通常靠一两层交换机,每个GPU以400G速度互联。大型集群需要更多层交换机,光学成本急剧上升。网络拓扑因供应商、当前和未来工作负载及资本支出而异。每栋楼通常包含一个或多个计算单元,用便宜的铜线或多模收发器连接内部,再通过长距离收发器在“岛屿”之间互联。155MW很难在一个地点搞定,但我们追踪到超过15个数据中心正在建设——包括Microsoft、Meta、Google、Amazon、字节跳动、X.AI、Oracle等——它们会有足够的空间容纳AI服务器和网络设备。

不同客户基于数据基础设施、成本、可维护性、电力、工作负载等因素选择不同网络拓扑。所以有的选Broadcom Tomahawk 5交换机,有的坚持InfiniBand,有的选NVIDIA Spectrum-X。接下来聊聊背后的原因。

回顾并行性

要理解网络设计、拓扑、可靠性和检查点策略,先回顾一下万亿参数训练里用的三种并行性:数据并行、张量并行和流水线并行。我们之前有一篇详细解释。

数据并行

是最简单的形式:每个GPU持有整个模型权重的副本,每个GPU(rank)拿到不同的数据子集。通信量最小,只需在GPU之间对梯度做全规约。但数据并行只在每个GPU有足够内存存放整个模型权重、激活和优化器状态时才有效。GPT-4这样1.8万亿参数的模型,训练时权重加优化器状态可能要用掉10.8TB内存。

张量并行

用来突破内存限制:每层的计算和权重分布在多个GPU上(通常沿隐藏维度拆分),每层内的自注意力、前馈网络和层归一化之间需要多次全规约交换中间结果。对带宽要求极高,尤其是低延迟。实际上,域内的每个GPU就像一台巨型GPU,协同处理每一层。张量并行按等级数减少每个GPU的内存占用。比如今天常用8个张量并行等级跑在NVLink上,内存占用降到1/8。

流水线并行

是另一种缓解内存压力的方法:每个GPU只负责一部分层的计算,把输出传给下一个GPU。所需内存按流水线等级数减少。通信量比张量并行轻一些。

为了最大化MFU,公司通常把三种并行组合成3D并行。具体做法:H100服务器内部用张量并行,同一岛内节点之间用流水线并行,岛之间因为网络较慢,就用数据并行(通信量最小)。

网络设计考虑因素

网络是跟着并行方案走的。如果每个GPU以最大带宽在全树拓扑中连接到其他所有GPU,成本会高得离谱——因为需要四层交换机,每多一层就得多一堆光学设备。

所以没人会给大型GPU集群部署完全的全树架构。相反,他们在计算岛内部搞全树,岛之间用较小带宽。方法很多,但大多数公司选择在网络顶层做“超额订阅”。看看Meta上一代GPU集群(最多32000个GPU):8个岛,每个岛内部全带宽,顶部层7:1超额订阅,岛间网络比岛内慢7倍。

GPU部署会用到多个网络:前端、后端和扩展网络(NVLink)。不同网络里可能跑不同的并行方案。NVLink是唯一能搞定张量并行带宽需求的网络。后端网络通常能轻松处理其他并行类型,但如果存在超额订阅,一般只适合跑数据并行。

有的公司甚至不在顶层超额订阅,而是把一部分流量从后端网络搬到前端网络。

混合InfiniBand和前端以太网结构

有些公司跨多个InfiniBand岛,用前端以太网做训练。前端网络成本低,还能复用现有的数据中心园区网络和区域路由。

但问题来了:随着模型因稀疏技术(如MoE)快速增长,前端网络需要处理的通信量也在猛增。这个权衡必须仔细优化,否则前端带宽涨上去,成本就和后端网络差不多了。

注意:Google在其多TPU pod训练中完全使用前端网络。他们的“计算结构”叫ICI,最大扩展到8960个芯片,通过昂贵的800G光学和光学电路交换机连接每64个TPU水冷机架。所以Google必须把TPU前端网络做得比大多数GPU前端网络更强才行。

训练时如果用前端网络,岛之间必须做网络拓扑感知的全规约。首先每个pod或岛在InfiniBand或ICI网络内做本地规约散射,让每个GPU/TPU拥有梯度的一个子部分;然后通过前端以太网在主机等级之间做跨pod all reduce;最后每个pod再执行一次pod级别的全规约。

前端网络还要负责加载数据。随着多模态(图像、视频)训练数据的发展,前端网络需求会指数级增长。加载大视频文件和做all reduce会抢带宽,而且存储流量不规则会导致滞后问题,整个all reduce变慢且难以预测。

另一种方案是四层InfiniBand网络,7:1超额订阅,每个pod包含24576个H100,非阻塞三层系统。相比使用前端网络,这种方案更容易在未来增加带宽——只需要增加A楼到B楼的光纤收发器,而不用升级集群里每个机箱的前端网卡。

这样网络模式更稳定:前端专心处理数据加载和检查点,后端专心做GPU间通信。也有助于缓解滞后问题。缺点嘛,四层InfiniBand非常贵,因为需要额外的交换机和收发器。

轨道优化 vs 机架中部

为了提高可维护性并多用铜线(<3米)和多模网络(<50米),有些客户放弃了NVIDIA推荐的轨道优化设计,转而采用机架中部设计。

轨道优化是一种让每台H100服务器连接到8个不同的叶交换机(而不是全连到同一个机架中部交换机)的技术,这样每个GPU只需一次交换机跳跃就能和更远的GPU通信,提升了实际场景中的all2all集合通信性能。all2all在混合专家模型(MoE)的专家并行中广泛使用。

但轨道优化的缺点也很明显:叶交换机不都在同一机架,必须用光学设备连接;叶到脊的距离可能超过50米,还得上单模光收发器。而非轨道优化设计则可以把GPU到叶交换机的98304个光收发器换成廉价的直连铜线,让25% – 33%的GPU结构变成铜线。如下图所示,GPU到叶交换机不再是向上走线缆托盘再横向跨越9个机架到专用轨道优化叶交换机机架,而是叶交换机就放在机架中部,每个GPU可以用DAC铜缆。

DAC铜缆跑起来更凉快、更省电、也更可靠——这对减少网络波动(链路间歇断开)和故障至关重要,后者是所有高速光互联的头号问题。用DAC铜缆时,Quantum-2 IB脊交换机功耗747瓦,换成多模光收发器就飙升到最多1500瓦。

此外,轨道优化的初始布线对数据中心技术人员来说非常耗时——每个链路两端相隔50米,不在同一机架。而机架中部设计里,叶交换机和连到它的GPU就在同一个机架里,还能在工厂里直接做集成测试。

可靠性与恢复

可靠性是这些大型集群最头疼的操作问题之一,因为前沿训练本质上是同步的。最常见的故障包括GPU HBM ECC错误、GPU驱动卡死、光学收发器故障、NIC过热等。节点不断宕机或输出错误数据。

为了保持较低的故障恢复平均时间(MTTR),数据中心必须在现场保留热备用节点和冷备用组件。一旦发生故障,最好直接换上已开启的备用工作节点继续训练,而不是停下整个训练任务。典型操作就是重启节点。但重启不是万能的,很多时候需要数据中心技术人员亲自物理诊断和更换设备。顺利的话几小时能修好一台故障GPU服务器,但有时要拖上几天。损坏的节点和热备用节点——虽然理论上有算力——实际上并没有为模型训练做出贡献。

训练过程中会频繁把模型检查点存到CPU内存或NAND SSD里,防止HBM ECC错误。一旦出错,就得从较慢的内存层重新加载模型权重,重启训练。故障容错训练技术(比如Oobleck)能提供用户级应用驱动的方法处理GPU和网络故障。

可惜,频繁的检查点和故障容错技术会影响MFU。集群要不停暂停去保存当前权重到持久化或CPU内存。通常每100次迭代保存一次,这意味着最多丢99步有用工作。在10万集群上,如果每次迭代耗时2秒,一次故障最多会丢掉229 GPU·天的工作。

另一种恢复方法:让备用节点通过后端结构从其他GPU上RDMA复制权重。由于后端GPU结构大约400Gbps,每个GPU有80GB HBM,复制只需约1.6秒。这种方法最多只丢1步,只损失2.3 GPU·天的计算,再加上1.85 GPU·天用来从其他GPU HBM复制权重。大多数领先的AI实验室已经部署了这种方案,但很多小公司还在用老办法——遇到故障就简单地从检查点重启。内存重构式的故障恢复能给大型训练运行提升好几个百分点的MFU。

最常见的问题之一是InfiniBand/RoCE链路故障。即使每个NIC到叶交换机链路的平均故障时间(MTTF)是5年,由于收发器数量巨大,一个新建的集群平均在26.28分钟内就会发生第一次作业故障。如果没有内存重构式的故障恢复,10万GPU集群光是因为光学设备故障而重启训练的时间,就会超过模型实际推进的时间。

由于每个GPU通过PCIe交换机直接连到ConnectX-7 NIC,网络架构层没有故障容错,故障必须在用户训练代码里处理——这直接增加了代码库的复杂度。这是当前NVIDIA和AMD GPU网络结构的主要挑战:只要一个NIC、一个收发器或一个GPU出问题,整个服务器就下线。目前正在大量研究如何让网络变得可重构、让节点不再这么脆弱。这项工作至关重要,因为现状意味着一个GB200 NVL72(价值数百万美元、72块GPU的机架)会因一个GPU或一个光学器件故障而整个下线,这比一台价值几十万美元的8 GPU服务器下线要灾难得多。

Nvidia注意到了这个重大问题,在芯片里加入了一个专用的RAS引擎。我们认为这个引擎会分析芯片级数据(温度、恢复的ECC重试次数、时钟速度、电压等),预测芯片何时可能故障,并警告数据中心技术人员,让他们主动维护(比如用更高风扇速度来维持可靠性,在后续维护窗口取出设备做物理检查)。另外,在启动训练作业之前,每个芯片的RAS引擎会做综合自检(比如运行矩阵乘法来检测静默数据损坏SDC)。

Cedar-7

有些客户(比如Microsoft/OpenAI)通过每台服务器使用Cedar Fever-7网络模块(而不是8个PCIe形式的ConnectX-7网卡)来做成本优化。主要好处:只需要4个OSFP笼子而不是8个,从而在计算节点端使用双端口2×400G收发器,而不仅限于交换机端。这样一来,GPU到叶交换机的收发器数量从98304减到49152。

由于GPU到叶交换机的链接数量减半,首次作业故障的估算时间也拉长了。我们估算每个双端口2×400G链接的MTTF为4年(相比单端口400G的5年),这样首次作业故障时间延长到42.05分钟,比没有Cedar-7模块的26.28分钟好得多。

Spectrum-X NVIDIA

目前我们正在部署一个基于NVIDIA Spectrum-X以太网的10万H100集群,年底前会投入使用。去年我们报道过Spectrum-X在大型网络中的各种优势。除了性能和可靠性优势,Spectrum-X还有巨大的成本优势。Spectrum-X的SN5600交换机有128个400G端口,而InfiniBand NDR Quantum-2交换机只有64个400G端口。值得注意,Broadcom的Tomahawk 5交换机ASIC也支持128个400G端口,这让当前一代InfiniBand处于劣势。

一个完全互连的10万集群可以只用3层而不是4层——少了1.33倍的收发器。由于Quantum-2交换机端口数少,10万集群上完全互连的GPU数量最多只能到65536个H100。下一代InfiniBand交换机叫Quantum-X800,拥有144个800G端口,从数字就能看出它专为NVL72和NVL36系统设计,预计不会在B200或B100集群里大量使用。用Spectrum-X虽然省钱,但不幸的是,你仍得买Nvidia LinkX产品线的高价收发器,因为别的收发器可能不兼容或没经过Nvidia验证。

使用Spectrum-X的主要优势在于它首先得到了NVIDIA库(如NCCL)的一等支持,而且Jensen会把你推到他新产品线的优先客户队列里。相比之下,用Tomahawk 5芯片,你需要大量内部工程资源来优化NCCL与网络的配合,才能达到最大吞吐。

用以太网代替InfiniBand做GPU结构的一个缺点是:以太网目前不支持SHARP网络内规约。网络内规约通过在交换机里的张量核心做每个GPU的求和,理论上能让网络带宽翻倍,因为它减少了每个GPU需要执行的发送和写入次数。

Spectrum-X的另一个缺点是:第一代400G Spectrum-X中,Nvidia用了Bluefield3而不是ConnectX-7作为临时方案。我们预计未来几代800G Spectrum-X中,ConnectX-8会完美工作。但Bluefield-3和ConnectX-7卡的价格差大约300美元,而且Bluefield-3功耗高出50瓦。因此每个节点额外需要400W功率,降低了整体训练服务器的“智能每皮焦耳”。使用Spectrum X的数据中心在10万GPU部署中需要额外5MW电力,相比使用同样网络架构的Broadcom Tomahawk 5部署。

Broadcom Tomahawk 5

为了避免支付Nvidia的高额费用,很多客户正在部署基于Broadcom Tomahawk 5的交换机。每个Tomahawk 5交换机有和Spectrum-X SN5600一样多的128个400G端口,只要公司有优秀的网络工程师,就能实现类似性能。而且,你可以从世界任何供应商处购买任何通用收发器和铜缆,自由搭配。

大多数客户直接和基于Broadcom交换机ASIC的ODM(比如Celestica)合作,并从Innolight、Eoptolink等公司采购收发器。基于交换机成本和通用收发器成本,Tomahawk 5比Nvidia InfiniBand便宜,也比Nvidia Spectrum-X便宜。

坏处是:你得有足够强的工程能力去为Tomahawk 5打补丁并优化NCCL通信集群。NCCL通信集群开箱只针对Nvidia Spectrum-X和InfiniBand做了优化。但好消息是:如果你有40亿美元去建10万集群,你大概率也有足够的工程能力去写NCCL优化并换掉InfiniBand。

接下来我们将讨论4种不同10万GPU集群网络设计的物料清单,包括相关的交换机和收发器成本,展示不同网络设计的优势,以及一个为减少光学设备而优化的GPU集群的物理平面图。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

相关攻略

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc