来源:互联网 更新时间:2026-07-06 21:01
7月6日,美团正式开源万亿参数大模型LongCat-2.0,同时放出了面向国产算力芯片的推理适配代码。模型总参数量达到1.6万亿,训练和推理时平均激活参数约480亿——专注智能体编程这一真实场景,而非堆叠算力跑分。
架构上的突破才是重头戏。LongCat-2.0首次引入LongCat稀疏注意力机制和N-gram Embedding结构:前者把长上下文处理效率和token级语义表征能力拉高了一个台阶,后者则让模型对代码逻辑、语法结构以及执行语义的理解更精准。面对智能体任务中动不动就超长的输入,它用流感知索引、跨层索引和层级化索引三种策略,把内存访问碎片化和重复索引计算开销压到最低,百万级长度的上下文训练和推理速度明显提升。更值得留意的是,在混合专家架构稀疏度已经做到97%的前提下,模型把1350亿参数集中塞进了N-gram Embedding模块——这个模块占总参数比例严格控制在10%以内,表达能力上去了,整体结构依然鲁棒、稳定。
这还不是全部。LongCat-2.0是首个在五万张国产加速卡集群上完成全流程推理验证的万亿参数模型,从模型设计、芯片特性适配到系统级部署,全程盯着国产算力平台的显存容量和带宽瓶颈做协同优化。模型层面,通过absorb计算范式、Indexer与MLA prolog并行调度、KV-cache分块切分,把超长序列带来的I/O压力和显存占用降下来;芯片适配层面,用Super Kernel整合算子、减少调用频次,再靠Weight Prefetch把权重加载延迟藏进前置计算周期里;部署策略层面,采用Prefill和Decode分离架构,既保证首字响应速度,又兼顾每秒输出吞吐量——Prefill阶段压缩专家并行域、引入序列并行分散负载,Decode阶段则靠KV-cache细粒度切分和高并行度调度,单卡显存峰值需求大幅降低。
后训练阶段同样有亮点。模型采用多教师在线蒸馏框架,把专家知识拆成三条路径:Agent执行、自适应推理、人机交互,分别强化自主任务执行、动态推理路径选择和安全对齐这些关键维度,最终通过MOPD架构在国产算力集群上高效融合、稳定跑起来。
整体技术路线延续LongCat-Flash,这次针对长上下文建模、代码生成和智能体行为建模三大核心场景做了三方面升级。开源的版本涵盖BF16、FP8、INT8等多种精度,适配从高性能服务器到边缘推理设备的各类国产硬件。目的很明确:把模型能力和推理优化成果全面释放出来,推动存量国产算力资源的高效复用,给国产算力生态的长期发展再添一把火。
55部泰腐剧全盘点,从《千星传说》到《以你的心诠释我的爱》
盘搜搜搜索入口地址 盘搜搜网盘资源在线查找入口
LITH币可以长期持有吗?LITH币价格最新行情
石头P30 Pro发布:8.98cm超薄热活水扫拖机器人
2026磁轴键盘超短触发选购指南
vivo手机怎么设置来电闪光灯 vivo手机来电提醒设置教程
闺蜜网名高冷女生(精选100个)
iPhone 18支持多少瓦快充 苹果18选购适配器充电器推荐
OpenAI SDK兼容调用火山引擎豆包API步骤
短剧《云端负烟火》剧情介绍
超级简历wondercv的会员功能有哪些区别
小米手机怎么设置屏幕刷新率固定在120Hz
网名孤独清冷英文女生(精选100个)
光环游戏助手核心功能实测:15倍速刷本与自动连点技巧【汇总】
电视剧《差一分的美味》剧情介绍
电视剧《她的罪名》剧情介绍
豆包API鉴权401报错火山引擎接入解决办法
USDT交易所有哪些?五个最佳USDT交易所推荐给大家
最能打的小模型,API调用免费了!
如何利用自然语言处理技术进行有效的文本分类和情感分析?
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc