来源:互联网 更新时间:2026-07-03 08:05
7月2日报道,最近几个月,一个名为“


▲Owl Alpha位列OpenRouter中Hermes调用模型第一
直到6月30日,这个神秘模型才揭开面纱:它是
从官方基准测试和实测反馈来看,LongCat-2.0在
相比榜单成绩,更值得关注的是,LongCat-2.0是
过去几年,行业一直在追问:
近日,结合多位接近项目人士、产业信源以及相关技术资料,我们试图还原这场
把时间拨回2023年初,ChatGPT发布后国内AI团队疯狂抢购算力,A100一卡难求,GPU供给进入极度紧缺状态。
侯龙(化名)在美团龙猫团队长期负责训练相关工作,从0到1参与了LongCat-2.0的诞生。他透露,2023年上半年,团队内部开始认真讨论一个方向:能不能用国产算力做大模型训练?这个想法最初只是“随口一提”,但后来越想越觉得并非不可能。
彼时,国产算力生态尚不成熟,工具链薄弱,成功案例稀缺。行业的普遍共识是“国产卡只能做推理”。但LongCat团队不这么看。
“
当时,这个团队的成员主要是做过一些搜广推、CV、语音类小模型的训练,并没有训练大模型的经验,但在机器学习Infra领域已有长足的积累。
团队将判断向上沟通后,快速得到了公司明确支持。最终决定:从基座模型建设伊始就同步布局国产算力。用侯龙的话说,“团队从上到下没有一个人说‘行不通、我不用’,大家都是建设性地想办法,看怎么能把这个事做成。”
“我们还是挺头铁的。”在侯龙看来,“行业认为不可能的事,反而是一次证明自己的机会。”
LongCat并不是一开始就站在5万卡的规模上。
据侯龙介绍,团队的国产算力训练经历了清晰的渐进扩容路径:
第一个关键里程碑出现在
第二个里程碑是
从千卡到万卡再到5万卡,每跨越一个数量级,都会遭遇完全意想不到的问题。
“
还有一类更隐秘的问题。到了几万卡的规模,团队发现了“
团队的做法是两条腿走路:一是每次故障都坚持找到根本原因,硬件故障也好、软件bug也好、参数配置问题也好,逐一归因并做针对性修复;二是不指望不出问题,而是追求出了问题之后能快速发现、快速恢复。最终,团队建立了一整套自动感知和恢复机制,整个容错过程不需要人工介入。
围绕
5万卡级别的训练,真正的挑战从来不是算力堆砌,而是系统工程。
在国产算力平台上做5万卡规模的训练,意味着几乎无法依赖现成的软件生态。
据一位曾参与国产算力训练万亿规模模型工作的业内人士介绍,随着训练规模持续扩大,需要重写的其实远不止几个算子,而是整套基础设施。“可以说,从
对此,侯龙也给予了正面回应,一个典型的例子是算子开发。在成熟生态上,一个算子可能一到两周就能完成;但在国产算力平台上,最初需要一个月以上。“同样的算子,开发周期差了好几倍,非常痛苦。”侯龙回忆。包括编程模型、调试工具在内的整个开发体验,早期都不太好用。
但团队没有等,而是在关键算子上选择自研。比如FlashAttention反向梯度算子,当时国产平台上有一个“确定性”实现,但为了做到计算顺序固定,退化成单核顺序执行,耗时比非确定性版本慢了20到70倍,在生产环境中几乎不可用。LongCat团队在国产芯片上自研了高性能的确定性算子,最终
这些底层算子的自研,最终使“整网确定性训练”成为可能,每一步的计算结果都能精确复现,任何一次异常都能被快速定位。在国产芯片工具链尚不完善的阶段,这是排障的刚需。
不过,国产算力的软件生态演进速度很快。据另一位知情人士透露,到了现在,虽然硬件架构不同导致编程范式有差异,但
更令人意外的是精度层面的发现。该人士透露,团队以CPU的FP64精度为基准标杆,对同一计算逻辑在不同芯片上做了对比实测,发现国产算力在部分核心算子上的计算误差甚至低于主流芯片。
从硬件架构上也能找到解释:国产芯片在累加位宽上做得更宽,能保证更高的累加精度。但更值得注意的是一种行业心态,
LongCat-2.0的意义,并不局限于完成了一次国产算力训练。
正如前文提到,在匿名上线OpenRouter期间,LongCat-2.0获得了全球开发者社区的广泛验证。同时,其在6月30日公布的综合评测显示,LongCat-2.0在编程和通用Agent两大场景中均表现优异。
▲LongCat-2.0的测评成绩
根据美团官方案例,LongCat-2.0在AI SQL Agent搭建、代码库迁移、儿童AI游戏训练场应用开发、3D交互演示、AI小说工厂等真实工作场景任务中都能较好完成任务。
▲基于LongCat-2.0的数据分析智能体(源自:美团)
而在Hermes中实测LongCat-2.0时发现,该模型在逻辑推理上表现较好,同时在编程任务上能够有较高完成度,且与Agent协同下能实现相对复杂的编程任务。最关键的是,受Cache(缓存)命中免费的策略影响,其Tokens消耗速度远低于同尺寸模型。
具体来看,测试中要求LongCat-2.0生成一个可交互的macOS桌面页面,它不仅能够生成一个十分相似的页面视图,还能生成可以点击的真实可用图标,比如点击文件、计算器、便笺等都能够进入对应的页面。其生成的计算器可以准确地算数,不过文档应用缺少保存选项。
▲LongCat-2.0生成的可交互macOS
当要求LongCat-2.0在Hermes上实现一个类似 Google Docs 的协同编辑系统,LongCat-2.0能够比较顺畅地完成,展现出可靠的编程及Agent能力。关键Token消耗速度只是其他竞品模型的五成,收费默认打“五折”就很好评。
▲LongCat-2.0生成的类Google Docs协同编辑系统
综合来看,LongCat-2.0已经接近全球第一梯队Agent模型能力。而更重要的是,这些能力是百分之百在国产算力上训练出来的,从而让这场持续三年的国产算力实验,拥有了更强的说服力。
LongCat-2.0的发布,真正验证了什么?
“我们2024年就验证了国产算力用于前沿训练完全可行,只是到今天才把结论明确讲出来。”一位参与项目的前龙猫成员表示。
在他看来,LongCat验证的不只是一个模型,而是
比如,LongCat-2.0提出了
ScMoE通过Shortcut连接让Dense FFN路径与MoE通信并行,理论推理延迟可降低约50%。零计算专家机制每层配置128个零专家与768个FFN专家共同路由——零专家不计算,直接返回输入,使激活参数量在330亿到560亿间动态变化,LongCat-2.0是业界首个实现此机制的大规模MoE模型。N-gram Embedding将embedding空间扩展约100倍,在代码生成、指令理解等任务上表现更稳定。
推理层面,龙猫团队针对国产算力显存与带宽受限的特点,采用大Expert Parallelism聚合访存带宽,通过上下文并行容纳百万级长上下文。算子层面实现精细控核、SuperKernel内联优化,将相邻算子的启动开销与计算重叠,端到端带来约8%的TPOT提升,极限TPOT(推理延迟)已接近行业主流水平。
把时间拉长到未来三到五年,
“这不是一个不可跨越的障碍。”侯龙表示。国产算力要真正坐稳全球第一梯队,关键在于
LongCat-2.0的出现,标志着国产算力在大模型训练领域迈过了一道关键门槛,从“能不能”进入“好不好”的阶段。
从2023年7月启动国产算力适配,到2024年春节端到端跑通,到2025年年中Flash版本发布时在技术报告里用“accelerator”而非“GPU”的隐晦表达,再到本周明确宣布“百分之百国产算力训练”,这背后是一条持续三年的技术演进路径。
当国产算力开始承载万亿参数级MoE模型的全流程训练和推理,这件事的意义已经超出了单一公司或单一模型,而是有望沉淀成整个国产AI基础设施的公共能力。未来AI竞争的重心,正在从单点突破走向系统级全栈能力的比拼。
问卷星官方网站入口地址 问卷星网页版在线使用
币安Binance官方中文网站 币安App最新版下载及新手注册指南
豆包AI专业版使用教程【新手必看】
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
摩托车活塞环性能如何
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
迷你网名古风男生霸气(精选100个)
文雅简易网名男生可爱(精选100个)
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
Ondo将于今日上线股票永续合约
陈姓和杨姓网名大全男生(精选100个)
网名开头英文名字男生(精选100个)
区块链存储板块是什么?有哪些?一文详解
暗黑4S14野蛮人终局BD攻略
免费网络收音机软件有哪些?高评分收音机APP推荐
时隔一个多月,Dify v1.15.0终于发布了!
《三角洲行动》S10赛季卡邮件技巧详解-三种方法及风险提示
电视剧《罗曼诺夫后裔》剧情介绍
郑好办app如何查询档案 郑好办app查询档案方法
迅雷云盘如何下载到本地速度最快
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc