来源:互联网 更新时间:2026-07-21 14:29
这两年,AI基础设施圈子里最常被提起的一个单位,就是P。一家公司有多少P的算力,装了多少张GPU,似乎成了衡量实力的最直观标尺。地方政府建智算中心,大模型公司采购算力,也基本绕着芯片数量和算力规模打转。
但进入Agent时代之后,这套游戏规则正在悄然发生变化。IDC的数据显示,2025年1月,中国企业级MaaS市场日均Token消耗量大约是1.6万亿,到了今年12月底,这个数字已经飙升至9.6万亿。更夸张的是,2026年全年的Token消耗量预计将冲到40000万亿,大约是2025年的20倍,折算下来日均接近110万亿。
背后驱动力,主要来自两个方向:多模态模型越来越成熟,Agent应用也开始规模化落地。Agent扮演的角色远比过去丰富,它不再只是被动回答问题,得能读更长的上下文,调用搜索、数据库和各种外部工具,还要能拆解任务、进行多轮推理。商汤大装置事业群首席科学家张行程在一次采访中打了个比方:以前聊天场景下,模型输入短、输出长;到了Agent场景,这个比例可能反过来,变成100:1甚至更高,上下文也从几万Token向几十万、上百万Token跃进。
所以,企业真正在买的不再是抽象算力,而是算力最终能产出的Token。大家开始认真算一笔账:同样一笔预算,能产出多少Token?同样一度电,能支撑多少次推理?模型迁移到新芯片,需要多久?高并发时,系统能不能扛得住?这些正在成为新的算力账本。
36kr了解到,在WAIC 2026期间,商汤大装置一口气发布了异构混合推理、全栈适配、算电协同Agent以及国产生态计划。核心目标很明确:当国产AI芯片越来越多,怎么把不同架构、不同性能的芯片有效组织起来,变成一套稳定、低成本、甚至能盈利的Token生产系统。这一切动作,都指向“最懂大模型的AI基础设施”这个定位。

过去,国产算力面临的首要问题是“有没有”。随着国产AI芯片公司陆续进入商业化阶段,问题已经变成了“怎么用”。不同芯片的硬件架构、编译器、算子、通信方式和软件工具链都不一样。一个在NVIDIA平台上跑得顺的模型,迁移到一款国产芯片上,往往要重新适配。换一款芯片,又得重新踩一遍坑。
张行程把这项工作形容为“苦活”。商汤从2018年就开始做国产芯片适配,逐步把芯片原厂、自己的研发团队、高校和科研机构组织到同一套体系里,还与上海人工智能实验室一起推动DeepLink开源体系,统一适配不同芯片的算子、编译和异构通信。
与此同时,Agent也开始被用来解决基础设施自身的问题。过去需要工程师逐个完成的算子迁移、开发和性能调优,现在可以由AI辅助完成。芯片厂商提供底层算子后,商汤大装置在平台上进行自动化迁移和优化,目的就是降低国产芯片进入新模型、新业务的工程成本。
但适配只是第一步。今年上半年,商汤大装置开始把一项此前跑通的技术推向规模化商业服务:异构混合推理。大模型推理通常可以分成Prefill和Decode两个阶段。Prefill负责读取、理解用户输入的大量上下文,计算密集;Decode则逐个生成Token,对显存带宽、延迟和稳定性要求更高。
传统方案里,这两个阶段往往由同一种GPU完成。商汤的解法是“分工合作”:让通用国产芯片承担Prefill,把高端芯片留给Decode,再通过统一网络、调度和缓存体系把它们连接起来。通过PD分离、异构组网和系统优化,以较低的硬件成本,获得更高的整体Token产出。
跟其他Token工厂不一样的是,能实现这种组合优化和技术落地,还离不开商汤大装置自建并持有的超大规模AIDC智算中心。商汤科技大装置事业群CTO宣善明表示,国产算力的优化不只是把模型迁移到一张国产卡上。依托自建的临港AIDC,商汤可以同时改造硬件组合、网络架构和软件系统,尝试不同国产芯片与高端芯片的异构组合。“每一点可能都不是特别长的板,但组合起来,就是平台型的长板。”相比之下,很多算力运营方没有机房物理改造权,软件厂商也很难打通硬件与网络系统,异构混合推理很难真正落地。
这套组合优化的关键,恰恰在于不追求某一张卡在所有任务中做到最好。商汤科技联合创始人、大装置事业群总裁杨帆用铁人三项打了个比方:一个游泳运动员独自参加铁人三项未必能取得好成绩,但如果允许三名擅长不同项目的运动员接力,整体成绩可能更高。
同样的逻辑也适用于AI基础设施。大语言模型、视频生成、世界模型、具身智能和AI for Science,对计算、显存和通信的要求各不相同。即使未来有更高端的国产芯片来承担Decode,旧一代芯片仍然可以负责Prefill或数据生成,新一代芯片处理更复杂的任务,异构组合不会因此消失。
在商汤看来,异构不是国产芯片尚未成熟时的权宜之计,而是在模型和硬件快速迭代、需求尚未收敛时,寻找系统最优解的方式。商业结果已经开始显现。据杨帆透露,国产混推集群目前已经可以实现正毛利率。
商汤大装置的Token服务量也在快速扩张。据其估计,日均服务量将从2026年初的约4000亿Token,上升到7月底的约2.42万亿,年底目标达到10万亿,大约是年初的25倍。
宣善明也坦言,国产算力的商业化不会在训练和推理环节同步发生。目前,国产芯片在模型训练上仍面临较大挑战,相对成熟的闭环更多出现在视频、图文等模型上。相比之下,推理更有可能率先放量:通过PD分离和异构混推,把不同芯片放到各自擅长的任务中,既能提高整体吞吐,也能让国产芯片进入真实业务。
商汤“最懂大模型”的定位,也建立在这种任务拆解能力之上。在杨帆看来,技术知识扩散很快,单一能力很难维持两年以上。更持久的壁垒,是组织能不能一直比别人快一步,看懂下游模型将往哪里演进,再反向调整基础设施。相比于其他AI企业,商汤有一个独特的组织优势:模型团队和基础设施团队距离足够近。比如商汤大装置首席科学家张行程,同时也参与商汤研究院的工作,两侧团队通过轮岗和共同研发,把模型负载变化快速传递到芯片选型、网络、缓存和调度系统中。
这种端到端能力也延伸到了电力系统。商汤临港AIDC于2024年获评全国首个5A级智算中心。这个认证综合考察了理论算力、有效算力、算力能效和业务场景支持能力等指标。
传统数据中心通常用PUE来衡量能源效率,但PUE只能反映有多少电被用于IT设备,没法回答这些电最终产出了多少有效Token。极端情况下,为了优化PUE,机房可能让服务器风扇高速运转,GPU却因温度或功耗限制降频,局部指标更好,实际算力产出反而下降。商汤大装置因此提出了TPW,也就是单位电力成本对应的Token产出。

在临港,商汤大装置把储能系统、机房管理系统和算力运营平台打通,根据任务实时性、电价和电网负荷来调度算力。离线推理、模型评测和部分预训练任务不需要立即执行,可以转移到电力负荷较低的时间段。比如7月上海电网进行需求响应时,临港数据中心在两小时内释放了75%的用电容量,减少用电约4.6万度。商汤大装置希望借此证明,智算中心不一定只是耗电大户,也可以成为电网中的弹性“容量池”。
不过,电费目前还不是国内Token业务能否盈利的决定性因素。杨帆判断,算电协同在国内大约可以形成10个百分点的成本差异,到了电价更高的东南亚、中东等海外市场,这个价值可能会更加突出。
事实上,中国并不缺建设智算中心的公司,但大量项目的参与者是分层、割裂的。有人提供机房,有人购买服务器,有人负责组网,有人包销算力,还有人面向最终客户做零售。每一层都需要利润,却没有一个主体能看见全部数据,更没法在模型、芯片、网络、电力和客户任务之间进行联合优化。
杨帆认为,只有真正接触终端流量,根据不同客户、模型和任务进行调度,才有可能找到Token成本的优化空间。
商汤大装置与大厂的差异也由此显现。阿里、火山等大厂同样具备从数据中心到模型和应用的端到端能力,但它们最优质的资源通常会优先服务自身的电商、内容和云业务。商汤大装置则愿意面向AI公司、科研机构和产业客户,提供
按照杨帆披露的目标,商汤计划建设至少5个万卡国产集群,服务超过200家AI初创组织。选择5个不同组合的万卡集群,而不是建一个单一架构的十万卡集群,正是为了保留面对不同模型和场景的灵活性。
区域项目则承担着验证商业模式的任务。在盐城,商汤智算中心一期规划了3000P算力,试图通过引入AI企业、产业链资源和基金,形成从基础设施到地方优势产业应用的闭环。中国香港项目计划在2026年底建成第一批算力集群,在2030年前建成具备40000P算力规模的智算中心。
沙特项目仍处于更早期的市场验证阶段。杨帆也承认,2026年AI基础设施出海的重点是布局和跑通路径,东南亚、中东目前只有少量项目,更大规模的收入可能要到下一阶段。
除了在沙特、中国香港落地项目,商汤大装置也在加速探索更多创新、更有想象力的场景,以此不断拓展国产算力的边界,比如太空算力。在2026 WAIC大会上,商汤大装置与国星宇航共建商汤算力星座,发射卫星进行初步验证。尽管未来两年,太空算力更多处于技术储备和预研阶段,但它在国内依然有很高的潜在价值,比如解决海外弱网络地区和卫星覆盖场景中的AI服务问题。
为了把技术能力扩大到更多国产软硬件,商汤大装置还联合芯片、核心零部件和AI Infra,发起了“银河计划”。这个计划要解决两个问题:第一,让国产化不只停留在GPU层面。一台服务器即使用了国产GPU,CPU、内存、光模块和交换机仍可能来自海外,国产CPU与GPU之间也存在适配和联调问题。硬件供应链需要软件、模型和真实应用共同验证,否则所谓“全国产”很容易停留在设备清单上。
第二,是为国产算力找到持续需求。具身智能、世界模型、视频生成和AI for Science等公司需要算力,却未必有能力自己完成芯片适配、集群运维和性能优化。商汤希望向它们提供算力、Token和工具,再把这些公司带入城市、科研和产业智能化项目。
东吴证券提出,2026年是“国产AI基础设施规模化商用元年”。从需求端来看,Token市场爆发式增长,供需缺口扩大;DeepSeek V4主动深度适配国产算力,为国产算力加速崛起奠定了基础。
一家国产AI基础设施服务商,用异构混合推理及端到端服务能力,让更多人看到了国产算力的曙光。
但对整个国产AI基础设施生态系统来说,前路漫漫。更大的挑战在于:如何让国产集群真正长期稳定运行?Token成本能不能持续下降?智算中心能不能保持足够高的利用率?客户愿不愿意一直续费?对商汤大装置而言,他们真正希望的是,“最懂大模型的AI基础设施”不只是一句口号,而是一笔清晰的经济账——每一张卡、每一个机柜、每一度电,最终都能变成被客户买单的高质量Token。
问卷星官方网站入口地址 问卷星网页版在线使用
七麦数据官网网页地址 七麦数据官方入口在线首页
币安Binance官方中文网站 币安App最新版下载及新手注册指南
闲鱼的严选验货在哪里看?闲鱼严选和验货宝哪个可靠
PokePay加密卡2026完整指南:申请开卡全攻略+多场景应用技巧
淘宝直播如何看回放在哪里看?怎么查看淘宝直播回放
摩托车活塞环性能如何
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
索尼限时赠送PS Plus Premium七日会员,需手
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
迷你网名古风男生霸气(精选100个)
豆包AI专业版使用教程【新手必看】
文雅简易网名男生可爱(精选100个)
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
《梦幻西游》特殊鬼怪怎么抓-隐藏变异鬼应对要点
币圈十大实用工具:从实时行情监控到数据分析、资产管理
王者荣耀「西行封妖记」【孙权-仙扇使者】6月25日上线!
闲鱼严选和验货宝哪个可靠?闲鱼的验货宝怎么样,,
币安杀入美股市场,重头戏bStocks还没来
陈姓和杨姓网名大全男生(精选100个)
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc