来源:互联网 更新时间:2026-08-07 14:06
大模型正从千亿参数的自然语言模型向万亿参数的多模态模型演进,这个趋势大家都有目共睹。随之而来的,是超万卡集群对底层计算能力的迫切需求——全面提升,刻不容缓。这不仅仅是堆硬件,更是一场从芯片、互联到架构的系统性升级,最终目标是支持更大规模的训练和推理任务。
面对万亿参数的多模态模型,单靠堆砌显卡已经行不通了。我们需要从四个维度进行系统性突破:单芯片能力的精进、超节点计算能力的跃升、基于DPU的多计算能力融合,以及对极致能效比的追求。
单芯片能力是万丈高楼平地起的基础,它包括了GPU自身的计算性能和显存访问性能两个核心部分。
在计算性能方面,设计更先进的GPU处理器是根本。在功耗允许的范围内,我们需要研发拥有更多并行处理核心、更高运行频率的单GPU。其次,通过优化高速缓存设计来减少内存访问延迟,也是提升运行效率的关键。再者,浮点数表示格式的优化,比如从FP16向FP8演进,通过引入新的存储方式和精度控制,可以在保证模型精度的前提下,大幅提升计算性能。最后,针对特定计算任务,可以在芯片上集成定制化的硬件加速逻辑单元。这种基于DSA的并行计算设计,对特定业务领域的计算速度提升非常显著。
在显存访问性能方面,挑战同样巨大。为了让万亿模型的数据布设在数万张GPU显存上,显存必须具备高带宽、大容量的特性。这要求我们采用基于2.5D/3D堆叠的HBM技术,它能有效缩短数据传输距离,降低访存延迟,并提升GPU计算单元与显存间的互联效率。通过这些技术,超万卡集群才能为智算中心提供强大的单卡算力,并为未来的大模型奠定坚实的硬件基础。
针对万亿模型,特别是处理超长序列和应用MoE架构时,巨量参数和庞大数据样本的计算效率是核心瓶颈。这直接引发了All2All通信模式下GPU卡间海量的通信需求。因此,超万卡集群的改进策略需要集中在几个关键领域。

如图2所示,通过引入节点内的Switch芯片,GPU卡间的点对点带宽得到了增强,这有效地提升了节点内的网络传输效率,满足了大模型日益增长的互联与带宽需求。可以说,这是为大模型并行计算提供强大硬件支持的关键一步。
在超万卡集群中,智算中心内部的数据交换需求呈指数级增长。如果还堆砌CPU资源来处理网络数据,只会又低效又昂贵。因此,计算架构必须转变:将原本运行在CPU、GPU中的数据处理任务,卸载到具有层级化可编程、低时延、统一管控特性的DPU上执行。
这带来的好处是,既能大幅扩展节点间的算力连接能力,又能释放被占用的CPU、GPU算力,降低协作成本,让集群发挥出更大的效能。具体来说,可以对智算中心进行软硬一体重构,打造计算、存储、网络、安全、管控五大引擎,并定义标准化的DPU片上驱动内核。
中国移动正是基于这一蓝图,于2020年开始打造具有自主知识产权的磐石DPU,并在2024年将其FPGA架构全面升级为ASIC架构。将磐石DPU这样的芯片融入现有智算中心,将算力集群从CPU+GPU双平台支撑,扩展至CPU+GPU+DPU三平台支撑,这有效打破了节点间的算力孤岛,突破了现有技术架构下的集群规模极限,让超万卡集群真正成为可能。
在制程工艺相对固定的条件下,芯片的高性能往往伴随着高功耗,散热问题日益严峻。面对高性能计算芯片功率密度急剧上升的现状,我们需要从制冷系统和GPU芯片两方面双管齐下。
在制冷系统方面,单机8卡GPU服务器的功耗早已数倍于通用服务器。为了增加计算密度、节省空间,超万卡集群建议采用成熟的冷板式液冷机柜。一个液冷机柜可容纳多台液冷GPU训练服务器,空间利用率远超传统风冷机柜。
在GPU芯片方面,提升能效比需要多领域协同。在芯片工艺上,采用7nm或更先进的制造工艺是降低晶体管功耗、提升集成度的必要手段。在架构设计上,需要创新优化片上总线、流水线结构、电压/频率策略以及时钟门控技术,以实现不同工作状态下的最优能耗效率。在软件层面,启用更精细的监控和分析,实时跟踪GPU运行数据,并不断优化算法和工作负载分配,才能真正实现均衡、高效的算力利用。通过这些设计与优化,不仅能提升用户的计算体验、降低成本,也为智算中心的可持续发展提供了可行的绿色方案。
要实现存储空间的高效利用和数据的高效流动,并支持集群的大规模扩展,超万卡集群必须采用多协议融合和自动分级存储技术。这是提升智算数据处理效率,支撑千亿乃至万亿大模型训练的关键。
超万卡集群的融合存储底座,需要承载AI全流程业务的数据处理。这意味着它必须兼容NFS、S3、并行客户端POSIX等多种协议,并支持各协议语义无损,达到与原生协议一样的生态兼容性。在不同阶段要实现数据零拷贝和格式零转换,确保前一阶段的输出可以无缝作为后一阶段的输入。这种“零等待”的效果,能显著提升大模型训练的效率。
为了满足大模型对存储高吞吐性能的需求,基于全局文件系统技术,可以支持超过3000个节点的扩展规模,为大模型训练提供百PB级全闪存储大集群能力。从闪存密度、数据面网络、并行客户端到对等通信机制,多个维度的系统性提升,能实现存储集群10TB/S级的聚合吞吐带宽和亿级IOPS。一个直观的效果是,智能算力利用率能提升20%以上,而大模型checkpoint的恢复时长可以从分钟级缩短至秒级。同时,对于高价值的智算存储数据,还能提供强一致性访问和高达99.9999%的可靠性。
超万卡集群的数据量是巨大的,其中大部分是温冷数据。所以,我们需要统筹考虑性能和成本,规划普通性能和高性能两类存储集群。普通性能集群使用混闪存储介质,具备低成本和大容量优势,负责温冷数据的存储;高性能集群则使用全闪介质,为大模型训练提供高吞吐,专门存放热数据。为了让智算应用高效地管理和访问数据,这两类存储集群对外应当呈现统一命名空间,并提供基于策略的数据自动分级流动能力。这样一来,冷热数据可以按照策略自动流转,避免了人工频繁介入,提升了存储系统整体的运行效率。
超万卡集群的网络可以划分为参数面、数据面、业务面和管理面。业务面和管理面通常采用传统的TCP方式部署。但参数面网络用于计算节点间的参数交换,对高带宽、无损能力要求极高;数据面网络用于计算节点访问存储节点,同样有高带宽无损的诉求。其中,参数面网络的要求最为苛刻,主要体现在四个方面:大规模、零丢包、高吞吐、高可靠。
目前业界成熟的参数面主要是InfiniBand (IB) 和 RoCE 两种技术。面向未来,为了满足AI大模型的大规模组网和高性能节点通信需求,业界也在探索新的技术,比如由中国移动主导的全调度以太网(GSE)方案和Linux Foundation成立的超以太网联盟(UEC)。它们的核心思路都是革新以太网现有通信栈,突破传统性能瓶颈。
根据不同的AI服务器规模,参数面网络推荐采用Spine-Leaf两层组网或胖树(Fat-Tree)组网。在Spine-Leaf两层组网中,每8台Leaf交换机和下挂的AI服务器组成一个group,以group为单位扩展。在group内部,采用多轨方案将AI服务器连接至Leaf交换机,所有网口按顺序分别上连到不同的Leaf。Spine和Leaf之间采用Full-mesh全连接,上下行收敛比为1:1。胖树组网则在此基础上增加了Core层,以pod为单位进行扩展,同样采用Full-mesh连接和1:1的收敛比。
分布式高性能应用的特点是“多打一”的Incast流量模型,这很容易造成交换机内部队列缓存的瞬时突发拥塞甚至丢包,损害分布式应用的性能。AI场景通常采用RoCEv2协议与DCQCN拥塞控制机制配合实现零丢包。DCQCN要求交换机对拥塞报文进行ECN标记。但传统手工配置静态ECN门限的方式,无法适配所有业务流量模型:水线配置低了,吞吐上不去;配置高了,又可能频繁触发PFC,影响其他业务。因此,建议部署动态ECN技术,通过AI算法根据实际流量模型计算出最优水线,在保证吞吐的同时维持低时延,达到最佳平衡。值得注意的是,无论是静态还是动态ECN,本质上都是被动拥塞控制。因此,中国移动提出了GSE技术,通过全局动态的主动授权机制,从根源上消除拥塞,突破RoCEv2的性能瓶颈。
AI场景的流量特征是流数少、单流带宽大。传统的ECMP基于5元组逐流HASH,在流数少时极易出现HASH不均。建议使用端口级负载均衡或算网协同负载均衡技术来替代。端口级负载均衡部署在Leaf交换机上,以源/目的端口作为均衡因子,消除哈希的不确定性。算网协同负载均衡则更进一步,AI调度平台会将任务信息通知给网络控制器,网络控制器结合全局拓扑,计算最优路径并动态配置到网络设备上,实现全网负载均衡,使网络吞吐可以稳定在95%以上。
网络作为业务流量的调度中枢,其稳定性决定着整个集群的运行效率。在典型的CLOS组网中,交换机间有多条路径。一条链路故障时,传统做法是通过路由收敛将流量切换到备用链路。但这个时间通常在秒级。然而在AI场景中,每次通信时间在毫秒级,秒级时间里已经完成了多轮通信。DPFR(数据面快速恢复)技术可以在此场景下做到毫秒级收敛。它通过故障快速感知、本地/远程快收敛等技术,让关键应用对故障几乎无感,业务性能在链路故障时无明显下降。
智算平台是智算中心的大脑和指挥中枢,它对底层的计算、存储、网络等IaaS资源进行云化管控,并向上提供资源纳管、任务调度、拓扑感知、全链路监控等核心服务。随着模型规模和数据量的激增,单集群规模达到万级,但平台性能往往不能线性增长,反而会有损耗。因此,我们必须借助高效的算力调度平台,结合算法、框架的优化,才能将算力平台的效能发挥到极致。业界通常以断点续训、并行计算优化和智能运维为切入点来构建高容错、高效能的平台。
大模型训练面临的最大困难,不是性能不够,而是如何确保训练任务不中断。硬件、软件、网络故障都可能随时出现。这种频繁中断带来的进度损失,对于耗时又耗资源的训练任务来说是难以承受的。当前业界的容错方案主要依赖于训练过程中周期性保存checkpoint,故障发生后从中断点之前的checkpoint重新启动训练。
典型的断点续训流程包括:基于平台运维监控能力检测故障、人工介入排查、隔离故障、重新调度容器、初始化通信、加载中断前的checkpoint信息、最后重新编译算子库。在这个过程中,checkpoint的密集程度、保存和恢复的性能至关重要。当模型参数达到百亿甚至千亿时,checkpoint的开销通常在几分钟到十几分钟之间,这会导致训练任务暂停,用户难以进行频繁操作。但如果拉长保存周期,一旦发生中断,损失就更大了。
为了解决这个问题,关键在于降低checkpoint流程的开销。业界通常采用checkpoint多级存储的方式,利用更高I/O性能的内存介质构建存储系统,大幅缩短训练暂停时间。同时,结合业务需求将checkpoint异步写入持久化存储,不干扰正常训练。当故障导致训练重启时,新启动的进程可以直接读取内存中的checkpoint数据,省去了读取网络存储的I/O开销。断点续训基于多级checkpoint、软硬件协同优化以及全栈系统级容错,能实现训练任务分钟级恢复,并且在商业化层面,为模型开发者提供了保障训练任务长期稳定运行的关键特性。
在超万卡集群中,分布式并行训练框架是标准配置。它将训练任务划分为多个子任务在多台计算机上并行执行。但超万卡集群节点多、资源类型不统一、数据量大、网络环境复杂,带来了两大挑战。
分布式并行框架在进行模型训练时,每个步骤都关系到运行效率。因此,超万卡集群的框架需要针对整个流程进行优化,并支持更多类型的模型加速技术。
随着集群规模的扩大,运维管控与集群应用之间的矛盾日益凸显。当AI加速卡从千级增长到万级时,故障范围扩大10倍以上,并迅速扩散到算网存多域全栈。要改变这一困境,必须引入新的运维理念——以全链路可视化监控、故障快速定位和运维侧快速修复为原则,建设新的智能运维系统。
这个系统需要具备算、网、存协同管理的端到端能力,包括计算、网络、存储、光模块等设备的全生命周期管理,最终目标是让大模型“训得快、训得稳、训得好”。新系统从底层建设开始,就应具备统一的容器化平台与公共技术底座。南向采集统一化,对被管单元进行资源、性能、告警、日志等信息的统一采集。系统核心应包含以下能力:
面向高密度、高能耗的智能算力发展,部署超万卡集群的新型智算中心,需要在确保设备安全、稳定、可靠运行的前提下,具备高效制冷、弹性扩展、敏捷部署、绿色低碳等特征,并实现智能化运维。
随着数据规模、集群能力的持续扩大,对新型智算底座的升级提出了更高要求。面向未来,我们需要在超节点、跨集群训练、软件框架等领域实现技术突破,并持续探索存算一体、光子芯片等先进技术,为下一次信息变革奠定基础。
Ondo将于今日上线股票永续合约
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
新破天一剑太极刀任务攻略 破天一剑怎么取太极刀
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
区块链OTC交易所有哪几家比较正规?
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
合集38个项目筹集5.406亿美元 Figure融资2亿
AMD英特尔集体失眠!英伟达Rosa CPU搭载Rigel核:单核性能碾压x86
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
五菱星光L六座新能源SUV上市:三版可选,中配12.28
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
macOS 28将移除Rosetta 2兼容层,Intel应用面临运行危机
腾讯ima怎么创建共享知识库?
全球首款AI智能体手机即将首秀!网友猜测或为豆包手机2代
小鸡答题今天的答案是什么2026年7月9日
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc