热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >Kimi K3 硬核开源,技术报告都说了啥

Kimi K3 硬核开源,技术报告都说了啥

来源:互联网 更新时间:2026-07-28 14:40

昨晚 11 点,月之暗面正式开放 Kimi K3 完整权重,技术报告也同步公开。2.8 万亿总参数、1040 亿激活参数、96 个 Safetensors 分片,整个仓库 1.56 TB,Kimi K3 这次真的亮了。

这组数字很容易让人先想到部署,不过对于绝大多数开发者来说,这个念头还是得放下,先看看技术报告比较合适。

图 1:Kimi K3 技术报告首页

读完报告,最大的感受是,K3 没有只讲怎么把模型做得更大。它花了相当多的篇幅回答一个更麻烦的问题:

怎样让 Agent 连续干几千步,中途还能记得自己在做什么,也不至于靠钻评分器空子拿到一个假高分。

2.8T 负责制造规模感,怎么让 Agent 干长活不散架,才是这份报告最有意思的部分。

百万上下文很长,K3 给它配了两种“记忆”

K3 支持 1,048,576 token 上下文。这个数字已经大到容易让人失去概念,于是先看它是怎么练出来的:预训练阶段从 8K 逐步拉到 64K,cooldown 阶段再从 256K 拉到 1M。

图 2:Kimi K3 整体架构

窗口拉长以后,另一个问题马上出现:前面一百万 token 的东西,总不能每一步都从头翻一遍。

K3 的主干采用“三层 KDA 加一层 Gated MLA”的循环结构,最后再补一个全局注意力层。

可以把 KDA 理解成工作台上的便签。它维护一个固定大小的循环状态,负责随手更新当前最需要的信息,成本不会随着历史无限膨胀。

MLA 更像档案室。它不需要每一层都出现,但会周期性保留全局内容交互,让模型有机会回头查更完整的上下文。三层 KDA 处理手边事务,一层 MLA 翻一次总账,最后再做一次全局检查。

这个比喻只负责帮助理解。技术上,它们对应的是固定大小循环状态与全局注意力交互的组合。

网络堆到 93 层,也会遇到“传话传丢”

K3 一共有 93 层,其中 69 层是 KDA,24 层是 Gated MLA。

网络变深以后,信息不只会在时间轴上变远,也会在模型层与层之间变远。某个早期层提取出来的关键表示,传到几十层以后,可能已经被反复加工得面目全非。

所以 K3 又加了 Block Attention Residuals。

普通残差连接更像把上一棒直接递给下一棒;Block AttnRes 允许当前层回头挑选更早深度块里的表示。K3 把网络划成 8 个十二层块,再加一个不完整的末尾块,让后面的层不必永远依赖“上一层转述”。

它和上下文窗口分工不同:窗口决定能装下多少历史,Block AttnRes 负责让深层网络方便地找回前面已经算出的东西。

896 个专家开会,每个 token 只叫 16 个

K3 是一个混合专家模型,共有 896 个路由专家。每处理一个 token,只选择其中 16 个,再加上两个共享专家。

这就是 2.8T 总参数与 104B 激活参数同时成立的原因:公司很大,真正参加这次会议的人只有一部分。

K3 还对专家权重使用 MXFP4、对激活使用 MXFP8,并配合量化感知训练。报告给出的约 2.5 倍 scaling efficiency,也是依据拟合的 scaling-law 曲线得出的。

这里千万别把“2.5 倍”顺手写成“推理快了 2.5 倍”。两者不是一回事。

而且“每次只激活 104B”也不代表部署时只需要装下 104B。完整稀疏权重仍然要存储和分发,1.56 TB 的仓库体积就摆在那里。

九个“老师”,最后教出一个 K3

架构解决了信息怎么流动,后训练才开始回答 Agent 怎么干活。

图 3:Kimi K3 强化学习规模变化

K3 的后训练包含 SFT、强化学习和 Multi-Teacher On-Policy Distillation。Moonshot 把任务分成三个领域:

  • 通用任务
  • 通用 Agent
  • 编码 Agent

每个领域再分 low、high、max 三档推理强度。三乘三,一共得到九个 expert teachers,最后再把这些教师的能力整合回同一个模型。

这套设计挺像先找九位专项教练:有人带基础体能,有人练工具使用,有人专门盯代码;训练结束后,再把九套经验交给同一个选手。

更有意思的是训练环境。报告描述了一套统一的白盒强化学习环境,会主动改变工具接口、提示词、上下文管理、技能、记忆和 Agent harness。

原因并不玄学。一个 Agent 如果只在固定工具和固定提示词里拿高分,很可能只是背熟了考场,而不是学会了解题。

Agent 最怕的,是学会“骗分”

长程任务有一个老问题:过程越长,标准答案越难写。

图 4:知识图谱引导的训练任务合成

K3 使用 Autonomous Execution Tasks,也就是 AET。系统只提供目标、工具、预算和独立验证器,不给模型一条现成的参考轨迹。Agent 可以自己找路径,最后看结果是否真的完成。

可一旦验证器完全公开,模型又可能学会迎合评分规则。于是报告里还加入了隐藏验证器和有限提交预算,用来防范 reward hacking。

这和写代码时只跑自己写的测试很像。测试全绿不一定代表修对了,也可能只是出题的人和答题的人共享了同一个盲区。隐藏验证器的价值,就是再补一双没有参与写答案的眼睛。

长任务还得有地方活着。AgentENV 使用可恢复的 Firecracker microVM 沙箱,支持暂停、恢复、分叉和快照。报告描述的长程个人助理轨迹,可以跨越数个模拟日、数千次工具调用和数百万上下文 token。

教师模型负责教能力,变化的 harness 负责换考场,AET 负责验收结果,AgentENV 负责让任务别在半路断电。到这里,K3 的 Agent 训练链路才算连起来。

需要说明的是:

目前公开的是完整模型权重和技术报告。报告详细描述了 AgentENV 与强化学习环境,不等于这些训练基础设施也已经随权重一起开源。

成绩很好看,先把评测条件一起记下来

编码、通用 Agent 和视觉 Agent 结果都很亮眼,可以直接看到各项数据。

图 5:Kimi K3 官方编码能力评测图
图 6:Kimi K3 官方通用 Agent 与视觉 Agent 评测图

但横向比较时,至少要把两个条件一起带上:K3 的评测使用 max reasoning effort,temperature 为 1.0。Agent 任务又会受到工具、上下文管理和 harness 的明显影响。

所以这些图适合回答“K3 在官方设定下做到了什么”,暂时不适合被压缩成一句“全面超过谁”。

这并不削弱报告的价值。恰恰相反,完整的架构、后训练和评测条件一起公开,才有机会判断数字是怎么来的。

最后

Kimi K3 这次正式开源,最直接的意义当然是权重终于能下载了。

但对大多数读者来说,更有用的东西可能藏在技术报告里:长上下文不只是把窗口拉长,深层网络还要能找回早期表示;Agent 不只是会调用工具,还要有可恢复的执行环境、独立验证器和不那么容易被钻空子的考场。

这套思路未必只能用在 K3 上。

以后再看一个 Agent 模型,可以多问四个问题:它怎么保存长任务状态?怎么跨层找回信息?训练时怎样更换工具和环境?最后又由谁来证明任务真的完成了?

这四个问题,比再背一遍参数量更有用。

参考链接

  • Kimi K3 模型卡与完整权重:https://huggingface.co/moonshotai/Kimi-K3
  • Kimi K3 技术报告:https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf
  • Kimi K3 权重文件:https://huggingface.co/moonshotai/Kimi-K3/tree/main
  • Kimi K3 官方博客:https://www.kimi.com/blog/kimi-k3
  • vLLM Kimi K3 部署说明:https://vllm.ai/blog/2026-07-27-k3
  • Kimi K3 真来了:从零写编译器,还连续48小时做芯片设计
关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc