来源:互联网 更新时间:2026-07-14 07:52
杭州AI芯片公司中昊芯英近日发布了第二代全自研高性能TPU芯片“须臾”。这款芯片的混合精度浮点算力达到了896TFLOPS,是上一代“刹那”芯片的3倍;8-bit推理算力达到1792TOPS,额定功耗为600W。与算力性能持平的传统芯片相比,其功耗降低了50%,执行同等AI任务时,综合计算效能可达传统GPU架构的数倍。
在集群部署层面,搭载须臾芯片的智算平台“泰则2.0”通过自研的低延迟高并行片间通讯协议,单个超节点可实现2048片须臾芯片直联,并可拓展搭建万卡超大规模集群。这意味着它能承载万亿参数大模型分布式训练、多智能体协同运算、全平台海量token并发推理等重负载业务。
围绕最新发布的须臾TPU芯片,中昊芯英创始人兼CEO杨龚轶凡与媒体进行了深入交流,分享了更多技术细节和产业思考。
中昊芯英成立于2018年,是国内最早投身于TPU架构AI专用算力芯片研发的企业之一。从创业之初,公司就确立了“把TPU架构做成AI界的x86”的目标,希望推动TPU成为AI领域的通用底层架构,对标CPU领域的x86架构,打造全行业通用的AI计算标准。产品系列命名“刹那”、“须臾”取自中国传统时间计量单位,意在打造融合中国传统文化与前沿半导体科技的企业文化。
须臾芯片已完成基础数据测试,完整软件适配正在推进中,整体性能对标海外先进的GPU与TPU,表现不落下风。目前,中昊芯英已完成MiniMax、智谱等国产主流大模型的适配。在多个落地场景中,单位美元token产出的性价比已超过海外头部GPU,单位token成本数据在国内同类芯片中具备领先优势。未来,公司会推进芯片与模型厂商的深度芯模联动和调优,进一步提升性价比。
据杨龚轶凡透露,中昊芯英会提前根据业务预判锁单备货,二代芯片须臾早已进入量产阶段,已有批量产品完成交付。须臾的PPA核心是平衡性能与芯片面积,并不以功耗为首要优化目标。设计目标是大幅压低单位token成本,从一代到二代直接减半,后续迭代有望降到原有的1/10。“优先拉高算力、降低单百万token硬件采购成本,对商业化落地的价值远高于单纯降功耗。”杨龚轶凡说。
他谈到,当前行业GPU整机采购成本占三年综合运营成本的70%-80%,能耗仅占20%。而中昊芯英的TPU产品采购与能耗成本比例约为7:3,可将芯片性能提升1.5-2倍,同时能耗降低20%-30%,因此更具市场竞争力。现阶段,中昊芯英侧重国内市场,研发优先级是先解决智能体落地痛点,再推进超大模型训练、视频算力、万卡超大规模集群等中长期目标。

杨龚轶凡谈到,须臾芯片专门针对长上下文做了底层架构适配,目标是原生稳定支撑百万token的完整上下文。从客户内测反馈来看,其整机综合性能实现了3倍以上提升,同时芯片售价仅小幅上调,百万token的推理性价实现了2倍以上提升。
相比上一代刹那芯片,须臾芯片在通信、存储、计算三大维度做了TPU专属定制优化,所有创新设计逻辑仅适配张量脉动架构。
杨龚轶凡解释说,TPU天生面向大模型矩阵乘加、Attention算子做数据流优化,数据复用率远高于通用GPU,重复内存读写开销大幅削减。同等算力输出仅消耗80%的功耗,这是整机能效领先的核心根源。
他进一步拆解了中昊芯英TPU和通用GPU优化思路的区别:GPU迭代会优先调整时钟频率、晶体管密度、低功耗器件(ULVT)来做功耗平衡;而TPU还有海量未挖掘的架构创新空间。现阶段,中昊芯英优先堆算力特性,将功耗优化放在次要位置。即便二代须臾芯片选用高功耗ULVT晶体管,TPU原生张量计算架构的先天能效依旧优于GPU,不用像GPU一样耗费大量研发资源反复权衡功耗、面积、性能三者的平衡,研发与流片成本更低。等未来TPU架构创新空间挖掘充分后,中昊芯英才会精细化做PPA功耗面积平衡调优。
先进封装方面,中昊芯英从第一代刹那TPU芯片起就完整落地了Chiplet芯粒架构。杨龚轶凡称,其整套Chiplet集成方案的复杂程度“远高于同行业”,完整走完落地验证路径,也为国内TPU产业沉淀了整套自主工程化知识体系。“如果没有我们初代产品率先打通这套高难度芯粒分层集成路线、落地量产验证,国内TPU整体产业化研发、落地进度会大幅滞后,”他谈道,“我们在多裸片先进封装、多芯粒协同领域的工程实践,为国内专用算力芯片行业提供了完整可复用的技术参考。”
针对智能体任务需求,杨龚轶凡总结了AI芯片的四大重点优化方向:
在杨龚轶凡看来,经过长期迭代,GPU的存储、计算配比已固化,相关硬件架构、软件栈的优化空间基本被挖掘殆尽。后续行业升级基本只依托先进制程、新型存储、新型半导体器件做微小调整,底层核心架构很难再做碘伏性革新。同时,完整的CUDA软件生态已成为GPU厂商最坚固的护城河,也是全行业切换技术路线最大的门槛,后来者很难实现弯道超车。
这正是中昊芯英自成立起就选择布局TPU赛道的原因。TPU架构天生面向大模型高并发张量计算做深度定制优化,在同等制程、同等硬件成本前提下,运行主流深度学习模型时,综合性能可达通用GPU的3-5倍。如果再结合针对特定模型网络的专属算子调优,性价比优势会进一步放大。
作为新兴专用张量架构,当前TPU仍有大量待挖掘的技术空白。硬件架构高度依赖产品流片、量产迭代来验证创新思路,硬件优化空间充足。中昊芯英计划在每一代芯片迭代中新增专属硬件特性,持续拉升算力与能效。
杨龚轶凡相信,只要AI产业持续扩张,Transformer与Attention算子仍是大模型底层核心计算单元,那么TPU架构的行业价值就会持续放大,相比通用GPU拥有更大的性能、性价比提升想象空间。这也是当下推理、智能体爆发阶段,TPU差异化壁垒不断凸显的核心根源。配合PD分离架构落地后,TPU的性价比优势还会进一步放大。虽然专用TPU的开发适配流程更为繁琐,但杨龚轶凡判断,只要长期综合性价比更高,企业大多都愿意选用,这给TPU赛道打开了巨大的成长空间。
杨龚轶凡认为,完整的软件生态是当前国产AI芯片产业面临的最大瓶颈。芯片硬件流片量产周期可控,但配套的算子库、开发工具、模型适配全链条搭建,需要3-5年甚至更久的打磨。现阶段,大模型、智能体商业化落地会在一定程度上降低生态适配门槛,但想要从“芯片可用”进阶到“好用、低成本”,持续优化算力性价比,仍是国内自研芯片厂商长期的核心攻坚难点。
通用GPU拥有二十年积累的成熟软件生态,而中昊芯英TPU的软件栈搭建周期仅一年半,差距客观存在,仍有很长的优化之路要走。在落地过程中,中昊芯英发现软件生态搭建难度远高于硬件集群搭建,完整软件栈、算子适配、工具链打磨需要海量自有算力持续迭代。该公司正在通过各类创新手段持续优化,逐步缩小差距。
杨龚轶凡相信,在行业进入大规模商业化落地阶段后,客户决策的核心会回归单位token性价比。“国内芯片厂商不需要像英伟达一样对全球所有模型做到很好适配,只需把国内几十家主流大模型厂商的产品做深度专属调优,就能在本土场景实现显著成本优势。”他强调,中昊芯英不会打造封闭独立的软件生态,将坚持全面拥抱开源,兼容全球主流开发平台,力求最大限度降低企业的适配负担。
算力成本对AI商业化落地至关重要。进入批量落地、持续对外提供服务的商业化阶段,企业首要诉求会转变为控制算力成本。杨龚轶凡称,深度芯模协同、持续降低训练与推理成本,会是中昊芯英中长期的核D核心合作方向。
面对上游供应链涨价、产能紧缺等行业冲击,中昊芯英会从芯片研发、产品设计、供应链管理、运营模式、财务统筹等多维度探索创新解法,降低客户长期token算力使用成本。具体应对策略包括:通过芯片架构升级提升性能、用高规格物料长期摊薄综合成本、通过提前备货平抑原材料价格波动等。
对于未来token价格的变化,杨龚轶凡预测,高时效复杂任务的Fast Token定价将持续走高,而离线批量推理任务的Slow token,则依托芯片架构优化、规模化集群摊薄成本,价格会不断走低。“长远来看,大模型甚至可以自主完成软件迁移、算子开发等工程工作,进一步降低企业人力与算力的双重开支。”杨龚轶凡说。
七麦数据官网网页地址 七麦数据官方入口在线首页
问卷星官方网站入口地址 问卷星网页版在线使用
币安Binance官方中文网站 币安App最新版下载及新手注册指南
闲鱼的严选验货在哪里看?闲鱼严选和验货宝哪个可靠
PokePay加密卡2026完整指南:申请开卡全攻略+多场景应用技巧
摩托车活塞环性能如何
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
豆包AI专业版使用教程【新手必看】
索尼限时赠送PS Plus Premium七日会员,需手
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
迷你网名古风男生霸气(精选100个)
文雅简易网名男生可爱(精选100个)
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
币圈十大实用工具:从实时行情监控到数据分析、资产管理
王者荣耀「西行封妖记」【孙权-仙扇使者】6月25日上线!
闲鱼严选和验货宝哪个可靠?闲鱼的验货宝怎么样,,
币安杀入美股市场,重头戏bStocks还没来
陈姓和杨姓网名大全男生(精选100个)
网名开头英文名字男生(精选100个)
区块链存储板块是什么?有哪些?一文详解
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc