来源:互联网 更新时间:2026-08-04 13:42
今天,月之暗面正式开源了2.8万亿参数模型Kimi K3,并同步发布了模型权重与技术报告。几乎同一时间,摩尔线程基于AI训推一体智算卡MTT S5000及MUSA软件栈,率先完成了Kimi K3的极速适配与稳定拉起。这不仅展示了MUSA软件生态面对前沿模型时的快速响应与全栈协同能力,也再次验证了国产全功能GPU在支撑万亿级大模型创新方面的工程实力。
作为全球首个开源的3万亿级别模型,也是Kimi迄今为止能力最强的版本,Kimi K3拥有2.8万亿参数,核心架构基于KDA混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术,并引入了Gated MLA与Stable LatentMoE等架构创新。它原生支持视觉理解,具备100万token的上下文窗口,专为长程编程、知识工作和推理等前沿智能场景设计。

图:Kimi K3在8张MTT S5000节点上的运行状态
与传统Transformer模型相比,Kimi K3的突破并非单纯靠堆参数。69层KDA与24层Gated MLA组成混合注意力主干,AttnRes重新设计了跨层信息流,而Stable LatentMoE则通过896个专家、每个token激活16个专家的配置,大幅提升了模型容量。新架构同时改变了算子、缓存、通信与调度方式,这对AI芯片的软件栈提出了系统性挑战。
摩尔线程在模型开源后第一时间完成了模型结构解析、权重加载、核心算子、缓存管理与分布式运行链路的适配,并打通了从SGLang-MUSA推理框架,到MATE算子库、Triton MUSA、TileLang MUSA的适配路径。MTCC编译器与MUSA运行时均高效支持SGLang JIT、DSL算子在MTT S5000上的快速部署运行。
面对Kimi K3官方提供的MXFP4 checkpoint,摩尔线程设计了一套加载期在线逐层量化方案,无需离线转换,为Day-0快速拉起K3模型推理提供了关键支撑。
这条链路既保证了Kimi K3架构语义的准确复现,也为后续融合算子、图执行、长上下文缓存和大规模PD分离优化预留了清晰的演进空间。
KDA是Kimi K3最核心的架构创新之一。它通过固定大小的递归状态来压缩历史信息,显著减少了长上下文场景下随序列长度持续增长的KV Cache压力,但同时也引入了与传统Attention完全不同的计算和内存管理方式。
针对Prefill阶段的大批量token计算与Decode阶段的逐token递归更新,摩尔线程分别完成了KDA Prefill、KDA Decode、短卷积和递归状态更新等关键路径的适配。Day-0版本以Triton MUSA的正确性实现作为稳定基线,并通过MATE统一算子接口衔接后续高性能内核。
在运行时侧,SGLang-MUSA同步适配了Hybrid State Pool,用于管理KDA的recurrent state与conv state,并支持状态分配、原地更新、快照和恢复。相较于只移植一个KDA算子,这套实现进一步覆盖了Prefix Cache、分块Prefill以及PD分离场景所需的状态生命周期,为百万上下文能力的工程落地打下了基础。
AttnRes通过可学习的跨层残差连接,使模型能够从前序多个Block的输出中动态聚合信息。它并不是普通Residual Add的简单替换,而是贯穿模型深度方向的一套状态与权重管理机制。
摩尔线程完成了AttnRes block bank、跨层残差聚合和模型执行顺序的框架适配,确保Kimi K3在深度方向上的信息流与官方模型定义一致。
与此同时,Gated MLA在MLA输出路径中增加了门控机制。MUSA软件栈完成了相关投影、门控、归一化与注意力路径的组合适配,并与KDA层共同纳入SGLang-MUSA的Hybrid Attention调度,使两类注意力模块能够在同一模型中稳定交替执行。
Kimi K3将MoE规模扩展至896个专家,每个token激活16个专家。面对更高的专家稀疏度,单纯完成TopK路由并不足以支撑分布式推理,还需要打通token dispatch、expert GEMM、combine以及跨卡All-to-All通信。
围绕Stable LatentMoE,摩尔线程快速完成了DeepEP对896专家、TopK 16激活规模的适配,打通了面向Kimi K3的token dispatch、combine与跨卡All-to-All通信链路,为模型Day-0拉起补齐了关键的MoE通信能力。
在此基础上,MUSA软件栈进一步完成了模型路由、专家映射和分布式执行链路的适配,并通过MCCL、DeepEP与MTSHMEM协同承载张量并行、专家并行和低时延通信,为Kimi K3在多机多卡环境中的规模化部署提供了基础。
Kimi K3的Day-0适配并不依赖单一算子方案,而是由多层次算子生态共同支撑。
完整的主流生态兼容迁移能力:MUSA在编程模型、运行时接口和主流AI生态接入层具备高度生态兼容与迁移能力,使上游主流生态实现能够被快速识别、迁移和验证,大幅缩短了新模型从社区代码到摩尔线程全功能GPU的适配周期。
Triton-MUSA提供稳定基线:对KDA、Gated MLA及相关融合计算,Triton-MUSA能够快速承接参考实现与正确性回退,在Day-0阶段优先保障模型语义、数值结果和执行稳定性。
TileLang-MUSA打通高性能内核开发:TileLang-MUSA工具链已经完整接入MUSA软件栈,可直接承载KDA、AttnRes、MoE等自定义算子的原型开发、JIT编译和性能迭代,让面向新架构的算子优化可以从高层DSL快速下沉到MTT S5000。
MATE提供统一算子调度:自研MATE算子优化引擎负责能力检测、算子选择与后端调度,将Triton、TileLang、预编译内核和稳定回退路径统一到同一调用接口中。由此,形成了“SGLang-MUSA → MATE → Triton/TileLang/MTCC → MUSA Runtime”的完整软件栈闭环。
面向万亿级模型,单机算子支持只是第一步。摩尔线程进一步打通了SGLang-MUSA与MCCL、DeepEP、MTSHMEM、Mooncake等组件的协同链路,覆盖张量并行、专家并行以及Prefill/Decode分离所需的模型执行、通信与状态传输能力。
其中,MCCL承担集合通信,DeepEP承载MoE token dispatch与combine,Mooncake负责PD分离场景下KV Cache与KDA state的跨节点迁移。框架、算子、通信和状态池由同一套调度体系衔接,使Kimi K3能够从单域正确性验证平滑扩展到多机多卡部署。
在MTT S5000平台上,Kimi K3已经完成模型加载、服务启动和基础推理链路验证。运行过程中,Prefill和Decode节点均展现出卓越的计算承载力,系统全程稳定运行,显存管控高效。
此次实现Kimi K3的极速支持,标志着摩尔线程在极短时间内完成了对前沿架构的精准解构、全链路打通与稳定验证。在此基础上,摩尔线程将继续推进KDA融合内核、TileLang-MUSA算子优化、MUSA Graph、Prefix Cache、长上下文内存管理以及大规模PD分离等能力,持续释放Kimi K3在MTT S5000上的性能潜力。
未来,摩尔线程将继续依托MUSA软件栈强大的生态兼容性,持续在第一时间拥抱并赋能前沿大模型生态,以高性能、可规模化的全功能GPU基础设施,加速AGI技术的创新与产业化落地。
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
腾讯ima怎么创建共享知识库?
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
腾讯ima怎么把微信内容一键导入知识库?
区块链OTC交易所有哪几家比较正规?
2026热门直线加速赛车手游推荐:高人气、爽快加速体验的精品榜单
kimi提示词专家使用方法新手指南
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
原神霜月三处月灵龛具体位置汇总
《幻兽帕鲁》不触发通缉捕捉传说商人方法
Windy卫星云图怎么看?云层变化识别技巧
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
为什么推特KOL都在BRC20赚钱 我一冲就亏?
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
一加手机如何设置三指长按屏幕局部截图
合集38个项目筹集5.406亿美元 Figure融资2亿
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc