热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >2026年下半年,算力竞赛为何突然转向超节点?

2026年下半年,算力竞赛为何突然转向超节点?

来源:互联网 更新时间:2026-07-27 14:28

中国大型互联网企业会在下半年大量部署超节点方案。

”一位算力资深人士判断,市场正在加速转向。虽然超节点整机价格通常高于同等卡数的普通服务器,但算力密度更高、空间占地更小——在有限空间里承载更多算力,这个账算得过来。新华三的人士也直言,超节点是个“大杀器”。

即便此前没有采用超节点的DeepSeek,最近也明确要入场,正在议价。一位云计算大厂人士告诉数智前线,这个信号很关键,有风向标意义。

这一热潮在2026世界人工智能大会上表现得尤为突出。华&为展出了由20个机柜组成的1024卡超节点真机,中科曙光则展示了沸腾着冷却液的640卡超节点,百度天池、阿里云灵骏真武M890、浪潮信息元脑以及沐曦曦景S600,都被放在了各自展台最显眼的位置。

超节点到底是什么?简单来说,它通过高速互联技术,把大量GPU或加速卡从“多台服务器”深度整合成逻辑上像一台“超级计算机”的系统。这解决了传统集群跨机器通信的带宽和延迟瓶颈,大幅提升GPU利用率,最终带来单位Token成本的下降。华&为资深人士的观点很明确:“

超节点已成为目前AI Infra建设的一个主流趋势。

一年前,超节点还是少数厂商展示系统能力的旗舰产品;一年后,它正在成为主流算力企业必须参与的军备赛。百度昆仑芯人士说,国产超节点从去年推出,目前已发展到可批量落地的阶段。“

到今年底,每家算力企业基本上都具备交付能力。

谁在造超节点

超节点不是新概念了。2024年,英伟达发布GB200 NVL72,将72颗Blackwell GPU纳入一个高速互联域,从此把这个架构带入业界视野。但最初的需求并不算旺。到了2025年,随着大模型参数暴涨,超节点才真正成为热点。国内厂商早在2024年前后就开始技术预研,最早一批产品在2025年上市,华&为、百度智能云、浪潮信息、新华三、中兴等纷纷跟进。超节点赛道,开始涌入多个玩家。

不过,各家争夺的焦点并不一样,目前形成了三条不同的路线:

一派不断扩大单个超节点的规模,一派更强调部署效率和经济性,还有一派试图用新的芯片和互联架构重新定义超节点

观察下来,

华&为、中科曙光和百度,在走向“大节点”

华&为

已向业界展示了由20个机柜组成的1024卡昇腾950超节点真机,并计划在今年第四季度批量交付8192卡超节点,这几乎是该超节点满配的技术上限。华&为的判断是,随着大模型参数、上下文长度和推理并发量持续增加,单个计算域需要容纳更多芯片和更大的内存空间。而去年推出的384卡超节点,已在互联网、金融、能源、教育和医疗等行业落地

750多套,证明了商业规模部署的能力

中科曙光

选择了浸没式液冷来支撑更高密度部署。单机柜640张加速卡,一台冷却设备带两个机柜。由这一超节点构建的十万卡算力集群曙光8000(登峰),已落地国家超算互联网郑州核心节点。“目前已跑满了90%,很多需求来自模型训练,也有AI for Science。”曙光人士告诉数智前线。

百度智能云

天池超节点则从256卡向512卡演进,后者将在年底推出。它强调从互联协议、交换芯片到液冷系统的全栈自研。百度智能云混合云部总经理杜海介绍,其超节点已经交付多个万卡集群。文心5.1重要版本的训练在全国产集群上完成,能源电力行业支撑了80多个行业场景的推理,也支撑了自研电力大模型的训练。

另一批厂商并不认同“越大越好”

阿里云

推出的灵骏真武M890,以64卡为一个Scale-up单元,再通过Scale-out网络扩展至更大集群。与多数超节点主要面向私有化部署不同,阿里还将这种算力形态放到了公共云上,客户不必采购设备,也能按需调用。

浪潮信息、沐曦

也选择了类似方向。浪潮信息去年推出64卡超节点,今年再推32卡产品。32卡足以支撑万亿级大模型推理。浪潮信息副总裁赵帅解释,“我们自己内部用万亿大模型做AI Coding,效率绝对比用千亿大模型好。这就是万亿参数大模型带来的价值。所以再次推出32卡产品,让更多企业真正用得起。”沐曦则以单柜64卡为基础,强调CUDA生态兼容和向万卡集群的横向扩展。

还有一些厂商试图跳出英伟达GPU或华&为加速卡的路线,走了第三条路

清微智能

采用可重构数据流架构,每颗芯片同时承担计算和数据转发,芯片之间可以直连,不需要交换机。清微智能产品副总裁陈逸伦介绍,已推出4096卡、峰值算力为500PFLOPS的超节点。北京某训练场已部署,内蒙、新疆、浙江的金融行业和国央企也已落地。采用同样路线的还有7月产品刚刚上市的

东方算芯

此外,摩尔线程也计划年底伴随新一代GPU推出相关产品。寒武纪目前虽然没有超节点,但业界判断下一代芯片也将推出超节点。至此,国内主要算力芯片和服务器企业,几乎都已进入这一赛道。

为什么是今年

超节点为什么会在今年爆发?业内认为有三大原因。

第一,模型训练和推理需求足够大

训练端

,模型参数量在飙升。7月Kimi发布了参数达2.8万亿的大模型K3。“下一个春节,模型参数会变成3万亿,再下一个6万亿,再后面是10万亿。而海外中等规模模型的参数量已经达到5万亿了。”沐曦CTO杨建博士告诉数智前线。业界通常认为,1万亿参数模型训练需要约5000张卡,3万亿参数约需1万张卡,6万亿则需要2万张卡。最好的解决方案,就是把多个芯片连成一体化去运作。

推理端

,华&为人士举例,AI Coding场景中,一个任务触发的操作调用已经达到几万次,复杂长程任务则是几十万甚至上百万次。“这意味着更多并发、更长上下文,这正是超节点大内存池的核心卖点。”从训推需求比例来看,阿里云资深人士透露,目前线上推理和训练的比例已接近5:1到10:1,“1万张卡里,大约70%到90%都在做推理,只有少部分在做训练”。

第二,账算得过来

。超节点的价格比同样卡数服务器总价要贵,但客户算的是总体效能账。“不能单看卡的数量,它涉及风火水电基础设施,超节点更集约。为什么大企业都去部署超节点?肯定是算得过来这个账。”新华三人士说。浪潮信息副总裁赵帅曾举例:“通过超节点,如果推理性能提升10倍,但耗电可能只提升2倍,算下来还有收益。”

昆仑芯人士介绍,传统模式下10台机器的算力相加不等于10,“只能等于6”,超节点通过高速互联把损耗降到最低,让更多算力发挥效能。如果用超节点做PD分离推理,系统比普通同卡数机器能提升30%到50%的性能。

第三,批量交付节点到了

。“超节点是工程化产物,它包含GPU芯片、存储、通信、交换、散热、供电、软件,不是单一厂商能独立搞定的。”昆仑芯人士说,“目前,超节点已发展到可批量落地阶段。”另一位人士补充,“无论性能做得怎么样,大家都可以把整机交付出来。”

不过,超节点更适合训练还是推理

?各家说法并不相同。

华&为人士认为,训练和推理都有价值,万亿参数大模型训练需要巨大内存池,Agent推理需要海量上下文并发,超节点必须配备大内存卡。摩尔线程认为,超节点要面向1万亿到5万亿参数大模型训练,以及高速推理的tokens工厂场景。而沐曦人士分析,“经过严密论证,超节点在推理的Decode阶段,也就是逐Token生成答案时,价值更为突出。”清微智能陈逸伦则判断,“目前超节点在训练侧跑微调较多,拿它做推理性能更好。”

分歧与共识

爆火之下,超节点技术路线存在诸多分歧,目前还没有标准答案,取决于各企业的技术商业判断。

第一个分歧是规模之争:超节点应该做多大?64卡/128卡,还是更大规模?

行业分成两个阵营,这里说的是超节点Scale-up的规模,也就是用高带宽、低时延互联,把多少芯片纳入一个紧耦合的计算域。

一部分业界人士是“小节点派”。“在我个人认知里,64卡就够了。TP并行、EP并行的最大规模可能就是64卡,剩下的通过PP和DP并行、Scale-out去连起来。没必要把单个节点的Scale-up做到足够大,因为任何通信都有延迟,TP和EP对延迟极度敏感,即便千卡互联中间几个微秒的延迟,GPU其实都在等。”一位人士分析,“对时延和稳定性都要有考虑,这是一个工程上的平衡,并不是Scale-up越大越好。”另一位人士持相同立场,“64到128卡是最经济的形态,再大就浪费了。”

另一些企业则是“大节点派”。华&为最新超节点扩展至1024卡,中科曙光640卡,百度天池、新华三均推进至512卡。他们的逻辑是:进入Agent时代后,万亿参数、百万Token上下文和海量并发推理之下,64卡和128卡小节点的统一内存池太小。“64卡更像基础机柜单元,适合中小规模模型微调、离线推理;万亿大模型的完整训练、大规模多智能体并发,必须依靠更大规模超节点。”

第二个分歧是CUDA兼容之争

。阿里平头哥、沐曦、海光等走CUDA兼容路线,代码迁移成本低。华&为昇腾、昆仑芯等则走自研生态路线。

一位大厂人士分析,自研生态虽然迁移成本高,但可控性和长期演进空间更大。他坦言,

也许两三年后,CUDA兼容就没有那么重要了

。“我们回归技术第一性,CUDA当年的胜出,是因为很多人做向量编程,心智负担很大,而CUDA方案让人在心智上的耗费极大降低,所以在过去10多年取得成功。但到了今天,有了Agentic coding之后,不一定是人去编程,都走向让Agent去干,所以CUDA就不那么重要了。”

一位华&为人士介绍,华&为是国内最先支持mxfP8和fp4精度的厂商,mxfP8的可变量比fp8更好。“

有人说昇腾从CANN走向了CUDA,其实并不完全正确。

”他说,“华&为增强了向量处理能力,而英伟达增强了矩阵处理能力,两家都走向了‘矩阵和向量综合型’方向。”

此外还有其他的分歧,比如连接中的铜缆与光纤之争,液冷中的风冷和液冷,特别是浸没式液冷。这些新旧技术转换中,因技术瓶颈、故障率与运维成本产生的矛盾和挑战,让业界有不同的技术商业选择。

一个共识是软硬架构协同

。超节点的演进与模型技术路线密切相关。国内模型架构如何演进?阿里人士告诉数智前线,国内模型企业的Attention正分化为两条路线:千问GDN、Kimi KDA走向Linear Attention;DeepSeek走Smart Attention(MLA、DSA、CSA),智谱目前也采用DeepSeek 3.2的DSA架构。两个阵营相对独立,仍需观察未来两三年的演进,这也会影响超节点的硬件适配方向。

浪潮信息董事长彭震最近介绍,过去基础设施主要沿摩尔定律演进,最新的进展是软硬件联合创新——一端提出新算法,另一端用新介质、硬件和网络去适配,收益显著。他看到美国企业也在开展类似的探索。

在沐曦杨建博士看来,这条赛道“未来二三十年都停不下来”。今年,他已经看到一些企业开始用AI参与设计,道路、房屋、机械等设计本质上都属于知识生产,AI的影响早已超出coding,正在渗透到各行各业。一位大型企业管理者希望,到2027年底实现“白天开会写规范,下班前交给大模型,第二天看结果”,人负责定义和发现问题,大模型负责求解。目前,AI知识创造的进程,“很多企业还没开始,因为总经理和董事长还没作出对数字员工的定岗决定。”资深人士观察,这正是AI要渗透的市场。

算力越便宜,行业扩张就越快,“整个链条就再也停不下来了”。美国的算力大约是中国的9倍。超节点,正成为这条产业链向下延伸的重要算力底座。随着更多厂商具备整机交付能力,真正激烈的竞争已经开始。

“现在比拼的是能否批量交付、稳定运行,并真正降低每Token成本。”一位大厂人士说。供应链是其中更大的挑战,“无论国产还是海外供应都存在不足。锁定供应链,未来发展才更有确定性。”

热门手游

相关攻略

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc