来源:互联网 更新时间:2026-07-28 13:39
写大模型本地部署相关的文章,可能这是一个阶段性的告别了。用 Qwen3.6-27B 作为收官之作,也算是某种巧合——比英伟达还会玩,本地部署速度翻了 2.5 倍。不过,真正让行业震动的,是 Kimi 兑现了承诺:K3 权重如约开源,2.8T 参数,全球最大开放权重模型,没有之一。权重文件来到惊人的 1.56 TB。
K3 整体能力仍然落后于 Claude Fable 5 和 GPT-5.6 Sol 这两个最强闭源模型,但在开源阵营里是断档领先。Coding 能力:Terminal Bench 2.1 上 88.3 分几乎追平 GPT-5.6 Sol,Program Bench 和 SWE Marathon 直接登顶,全面压制 GLM-5.2。Agent 能力:BrowseComp 91.2 分全场第一,JobBench、SpreadsheetBench、AutomationBench 都排在开源第一梯队。
这已经是让闭源模型胆战的实力了。
值得一提的是,Kimi 现在的订阅价格也追平 Claude 和 GPT 了。Kimi 套餐价格分别是 49 元、99 元、199 元、699 元每月;ChatGPT 定价分别是 8 美元、20 美元、100 美元(Pro 5x)、200 美元(Pro 20x)。感觉 Kimi 是照着闭源旗舰模型定价直接乘汇率来的。缺点也很明显:消耗速度太快,即便 199 的套餐,也很难撑得住。
2.8T 参数的大模型,模型文件只有 1.56TB,这是因为 K3 从 SFT 阶段就开始做量化感知训练(QAT),权重原生就是 MXFP4、激活 MXFP8。MXFP4 是 4 bit 权重加块级缩放因子,折算下来每参数约 4.25 bit,也就是约 0.53 字节,估算一下:
2.8T 参数 × 0.53 字节 ≈ 1.5TB
注意,这个 1.56TB 已经是“压缩后”的状态了,别指望像 GLM-5.2 那样“换 FP8 再砍一半”——K3 的 MXFP4 是训练出来的原生精度,在这个基础上再做 post-training 量化,精度损失会叠加,官方也没提供更高精度的版本让你往下量化。
前文提到过本地部署 GLM-5.2 的成本:743B 的 GLM-5.2 原版模型私有化部署,
占显存的不只是权重,还有推理框架运行空间、激活值、KV Cache 和并发预留。参照 vLLM 对 GLM-5.2 的预算系数(756GB 权重对应 893GB 最低显存,约 1.18 倍),K3 的最低显存需求估算:
1.56TB × 1.18 ≈ 1.84TB
好消息是 KDA 线性注意力对长上下文的 KV Cache 压力比传统 attention 小很多,官方还给 vLLM 贡献了 KDA prefix cache 实现。
多机推理做张量并行和专家并行,卡数按 2 的幂次方规划最省心(16、32、64),这也是主流推理框架分片的舒适区。
16×H200 = 2256GB 显存,装下 1.56TB 权重后剩余约 700GB 给 KV Cache 和运行时,可以跑,但上下文和并发都要精打细算,128K 上下文起步的体验档。多机就绕不开高速网络,200G 起步的 RDMA 交换机、光模块、线缆:
| 项目 | 预算 |
|---|---|
| 两台 8×H200 服务器 | 约 700 万元 |
| 高速网络及线缆 | 约 30 万—100 万元 |
| 合计 | 约 730 万—800 万元 |
4512GB 显存,权重之外还有约 3TB 余量,长上下文和像样的并发才开始成为可能。
官方技术博客原话:推理效率受益于更大的高带宽通信域,
| 项目 | 预算 |
|---|---|
| 八台 8×H200 服务器 | 约 2800 万元 |
| 高速网络及线缆 | 约 100 万—200 万元 |
| 合计 | 约 2900 万—3000 万元 |
到这个规模,机房也要跟着升级:单台整机功耗约 10.2kW,八台就是 80kW+,高密机柜、PDU、供电改造、散热全都要动,不过相比整机采购这都是小钱了。
前面提到长鑫科技,刚刷到一个视频讲长鑫与合肥的故事,有点感触。多说两句:当年内存被三星、海力士、美光三家攥在手里,说涨价就涨价,说断供就断供,国内厂商连上牌桌的资格都没有。合肥掏出真金白银陪长鑫蹲了快十年冷板凳,从流片失败到良率爬坡,没人看好,直到今天——内存涨价周期里,长鑫成了那个别人绕不开的名字。
这个剧本,正在大模型行业重演。看看现在用 Claude 的姿势有多拧巴:一边被 Anthropic 封号,一边在群里骂它霸道,骂完转头又找渠道求着续上——被人拿捏成这样,气不气?气,但没办法,谁让人家模型确实强。
长鑫的故事讲的没什么玄妙的道理,被卡脖子的行业,出路只有一条:自己造出来,而且造得足够好。GLM-5.2、Kimi K3 们正在走这条路,差距还有,但方向已经很清楚了:闭源模型的每一次封号、每一次涨价、每一次区域限制,都是在给国产开源模型送用户。
内存我们熬了十年,大模型不用等那么久。到那天,封号就封吧,随便封。
摩托车活塞环性能如何
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
Ondo将于今日上线股票永续合约
电视剧《罗曼诺夫后裔》剧情介绍
暗黑4S14野蛮人终局BD攻略
区块链OTC交易所有哪几家比较正规?
什么是山寨币?山寨币指数如何查看?全球前10大山寨币盘点
Binance新增15种bStocks代币化证券为杠杆抵押资产
全球十大加密货币APP v3.11.5正版下载
GLM-4.5发布,全网最全测评和使用教程来了!
洛的网名三字男生霸气(精选100个)
本周比特币行情预判:BTC后市的三种推演与两强对决
剑侠世界3雪峰论剑怎么打-剑侠世界3雪峰论剑打法介绍
Meme币DOGS今晚上线!开局就解锁91%代币是否带来风险?
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
姓徐和李取网名男生霸气(精选100个)
25年来最惨单月 微软市值本月重挫近4万亿:押注AI也没赢麻
超长高标准质保+总部直保售后体系:小牛真实售后体验大起底
比特币守住关键支撑,HYPE市值升至第九并反超DOGE
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc