来源:互联网 更新时间:2026-07-28 14:40
昨晚 11 点,月之暗面正式开放 Kimi K3 完整权重,技术报告也同步公开。2.8 万亿总参数、1040 亿激活参数、96 个 Safetensors 分片,整个仓库 1.56 TB,Kimi K3 这次真的亮了。
这组数字很容易让人先想到部署,不过对于绝大多数开发者来说,这个念头还是得放下,先看看技术报告比较合适。

读完报告,最大的感受是,K3 没有只讲怎么把模型做得更大。它花了相当多的篇幅回答一个更麻烦的问题:
2.8T 负责制造规模感,怎么让 Agent 干长活不散架,才是这份报告最有意思的部分。
K3 支持 1,048,576 token 上下文。这个数字已经大到容易让人失去概念,于是先看它是怎么练出来的:预训练阶段从 8K 逐步拉到 64K,cooldown 阶段再从 256K 拉到 1M。

窗口拉长以后,另一个问题马上出现:前面一百万 token 的东西,总不能每一步都从头翻一遍。
K3 的主干采用“三层 KDA 加一层 Gated MLA”的循环结构,最后再补一个全局注意力层。
可以把 KDA 理解成工作台上的便签。它维护一个固定大小的循环状态,负责随手更新当前最需要的信息,成本不会随着历史无限膨胀。
MLA 更像档案室。它不需要每一层都出现,但会周期性保留全局内容交互,让模型有机会回头查更完整的上下文。三层 KDA 处理手边事务,一层 MLA 翻一次总账,最后再做一次全局检查。
这个比喻只负责帮助理解。技术上,它们对应的是固定大小循环状态与全局注意力交互的组合。
K3 一共有 93 层,其中 69 层是 KDA,24 层是 Gated MLA。
网络变深以后,信息不只会在时间轴上变远,也会在模型层与层之间变远。某个早期层提取出来的关键表示,传到几十层以后,可能已经被反复加工得面目全非。
所以 K3 又加了 Block Attention Residuals。
普通残差连接更像把上一棒直接递给下一棒;Block AttnRes 允许当前层回头挑选更早深度块里的表示。K3 把网络划成 8 个十二层块,再加一个不完整的末尾块,让后面的层不必永远依赖“上一层转述”。
它和上下文窗口分工不同:窗口决定能装下多少历史,Block AttnRes 负责让深层网络方便地找回前面已经算出的东西。
K3 是一个混合专家模型,共有 896 个路由专家。每处理一个 token,只选择其中 16 个,再加上两个共享专家。
这就是 2.8T 总参数与 104B 激活参数同时成立的原因:公司很大,真正参加这次会议的人只有一部分。
K3 还对专家权重使用 MXFP4、对激活使用 MXFP8,并配合量化感知训练。报告给出的约 2.5 倍 scaling efficiency,也是依据拟合的 scaling-law 曲线得出的。
这里千万别把“2.5 倍”顺手写成“推理快了 2.5 倍”。两者不是一回事。
而且“每次只激活 104B”也不代表部署时只需要装下 104B。完整稀疏权重仍然要存储和分发,1.56 TB 的仓库体积就摆在那里。
架构解决了信息怎么流动,后训练才开始回答 Agent 怎么干活。

K3 的后训练包含 SFT、强化学习和 Multi-Teacher On-Policy Distillation。Moonshot 把任务分成三个领域:
每个领域再分 low、high、max 三档推理强度。三乘三,一共得到九个 expert teachers,最后再把这些教师的能力整合回同一个模型。
这套设计挺像先找九位专项教练:有人带基础体能,有人练工具使用,有人专门盯代码;训练结束后,再把九套经验交给同一个选手。
更有意思的是训练环境。报告描述了一套统一的白盒强化学习环境,会主动改变工具接口、提示词、上下文管理、技能、记忆和 Agent harness。
原因并不玄学。一个 Agent 如果只在固定工具和固定提示词里拿高分,很可能只是背熟了考场,而不是学会了解题。
长程任务有一个老问题:过程越长,标准答案越难写。

K3 使用 Autonomous Execution Tasks,也就是 AET。系统只提供目标、工具、预算和独立验证器,不给模型一条现成的参考轨迹。Agent 可以自己找路径,最后看结果是否真的完成。
可一旦验证器完全公开,模型又可能学会迎合评分规则。于是报告里还加入了隐藏验证器和有限提交预算,用来防范 reward hacking。
这和写代码时只跑自己写的测试很像。测试全绿不一定代表修对了,也可能只是出题的人和答题的人共享了同一个盲区。隐藏验证器的价值,就是再补一双没有参与写答案的眼睛。
长任务还得有地方活着。AgentENV 使用可恢复的 Firecracker microVM 沙箱,支持暂停、恢复、分叉和快照。报告描述的长程个人助理轨迹,可以跨越数个模拟日、数千次工具调用和数百万上下文 token。
教师模型负责教能力,变化的 harness 负责换考场,AET 负责验收结果,AgentENV 负责让任务别在半路断电。到这里,K3 的 Agent 训练链路才算连起来。
需要说明的是:
编码、通用 Agent 和视觉 Agent 结果都很亮眼,可以直接看到各项数据。


但横向比较时,至少要把两个条件一起带上:K3 的评测使用 max reasoning effort,temperature 为 1.0。Agent 任务又会受到工具、上下文管理和 harness 的明显影响。
所以这些图适合回答“K3 在官方设定下做到了什么”,暂时不适合被压缩成一句“全面超过谁”。
这并不削弱报告的价值。恰恰相反,完整的架构、后训练和评测条件一起公开,才有机会判断数字是怎么来的。
Kimi K3 这次正式开源,最直接的意义当然是权重终于能下载了。
但对大多数读者来说,更有用的东西可能藏在技术报告里:长上下文不只是把窗口拉长,深层网络还要能找回早期表示;Agent 不只是会调用工具,还要有可恢复的执行环境、独立验证器和不那么容易被钻空子的考场。
这套思路未必只能用在 K3 上。
以后再看一个 Agent 模型,可以多问四个问题:它怎么保存长任务状态?怎么跨层找回信息?训练时怎样更换工具和环境?最后又由谁来证明任务真的完成了?
这四个问题,比再背一遍参数量更有用。
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
摩托车活塞环性能如何
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
Ondo将于今日上线股票永续合约
电视剧《罗曼诺夫后裔》剧情介绍
暗黑4S14野蛮人终局BD攻略
《三角洲行动》S10赛季卡邮件技巧详解-三种方法及风险提示
如何在火狐浏览器中彻底禁用自动更新功能?
区块链OTC交易所有哪几家比较正规?
手机qq浏览器误删文件如何找回-手机qq浏览器误删除文件怎样恢复
360浏览器如何设置网页缩放比例
《三角洲行动》GTI超人成就解锁攻略-满辐射状态击杀技巧详解
全链网:戴蒙或继续担任摩根大通首席执行官三年
什么是山寨币?山寨币指数如何查看?全球前10大山寨币盘点
Binance新增15种bStocks代币化证券为杠杆抵押资产
Sophon正在关闭其Layer2区块链并迁移到Base
全球十大加密货币APP v3.11.5正版下载
异环1.2前瞻什么时候
《三角洲行动》ASh-12战斗步枪改装攻略-省钱与击杀方案详解
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc