来源:互联网 更新时间:2026-08-07 07:20
阿里通义大模型家族迎来了新成员——Qwen3系列,这次一口气开源了8个规格的模型。
4月29日凌晨,阿里云正式对外开源了Qwen3系列,包括2个MoE模型和6个稠密模型。发布仅2小时,它在GitHub上的star数就突破了16.9k,热度可想而知。


但最让人眼前一亮的,还是旗舰型号Qwen3-235B-A22B。它在编程、数学、通用能力等多项基准测试中,直接把DeepSeek-R1、OpenAI o1甚至o3-mini、Grok-3、Gemini-2.5-Pro这些大家熟悉的名字甩在了身后。具体都有哪些亮点?往下看。

这次升级的核心,可以归纳为五个关键点:
第一,8种参数规格的模型齐发。从小巧的0.6B到旗舰级235B总参数、220亿激活参数的MoE模型,覆盖了稠密和MoE两种路线。具体包括0.6B、1.7B、4B、8B、14B、32B六个稠密模型,加上Qwen3-235B-A22B和Qwen3-30B-A3B两个MoE模型。
第二,引入了混合思考模式。用户可以根据任务复杂度,自由切换"思考模式"和"非思考模式",自己掌控模型的思考深度。这在实际使用中非常灵活。
第三,推理能力大幅提升。在思考模式下,数学、代码和常识逻辑推理能力超越了上一代的QwQ;在非思考模式下,又全面领先Qwen2.5 instruct系列。
第四,支持MCP协议(模型上下文协议),Agent能力实现跃升。无论思考还是非思考模式,模型都能与外部数据源和工具集成,完成更复杂的任务调度。
第五,语言覆盖面极度扩展,支持119种语言和方言,涵盖理解、推理、指令跟随和生成等全链路能力。

目前,Qwen3系列已在Hugging Face、ModelScope和Kaggle等主流平台开源,基于Apache 2.0许可证。部署方面,官方建议开发者优先使用SGLang和vLLM框架;本地部署的话,Ollama、LMStudio、MLX、llama.cpp都是不错的选择。
值得留意的是,Qwen3调整了命名方式:后训练模型不再带"-Instruct"后缀,基础模型统一用"-Base"标注。
先看具体参数。6个稠密模型中,0.6B到4B规格的上下文长度为32K,8B到32B规格的则达到128K。

两个MoE模型的上下文长度均为128K。

真正的亮点在于效率。小型MoE模型Qwen3-30B-A3B,激活参数仅为QwQ-32B的十分之一,却实现了性能反超。更夸张的是,Qwen3-4B这个小模型,性能直接与Qwen2.5-72B-Instructor持平。


从基准测试数据来看,Qwen3-1.7B/4B/8B/14B/32B-Base的性能,分别与Qwen2.5-3B/7B/14B/32B/72B-Base相当。也就是说,用更小的参数规模,干掉了更大的前辈。
尤其在STEM(科学、技术、工程、数学)、编程和推理领域,Qwen3稠密模型的性能甚至优于参数规模更大的Qwen2.5系列。

▲Qwen3系列与Qwen2.5系列基准测试对比
Qwen3的三大技术亮点,值得展开说说。
首先是混合思维模式。简单来说,就是模型支持"思考"和"非思考"两种工作状态。思考模式下,模型会逐步推理、花费时间给出最终答案,适合处理需要深度思考的复杂问题;非思考模式下,响应几乎是瞬间的,适合对速度要求高的轻量任务。

▲思考和非思考模式对比
这种设计意味着,用户可以根据任务难度自由控制模型的"思考预算"——难题就用扩展推理慢慢啃,简单问题直接秒回,延迟几乎为零。更重要的是,这两种模式的融合还强化了模型对思考预算的稳定控制能力,开发者可以针对特定任务配置预算,在成本效率和推理质量之间找到最佳平衡点。
多语言能力方面,Qwen3覆盖了119种语言和方言,对全球化的应用场景来说意义重大。

此外,Qwen3在编程和Agent能力上的提升同样显著,核心支撑就是集成了MCP协议,让模型与外部工具、数据源的协作更加流畅。
性能提升背后,是数据规模和技术路线的双重进化。
与Qwen2.5相比,Qwen3的预训练数据集直接翻了两倍——从1800亿token增加到大约3600亿token。为了凑齐这么大的数据集,研发团队收集了网络数据、PDF文档数据,并用Qwen2.5-VL从文档中提取文本,再用Qwen2.5提升内容质量。数学和代码方面,则通过Qwen2.5-Math和Qwen2.5-Coder生成教科书、问答对和代码片段等合成数据。
预训练分为三个阶段:
第一阶段,模型在超过3000亿token上预训练,上下文长度为4K,主要打好语言和知识的基础;第二阶段,增加STEM、编程、推理等知识密集型数据比例,再预训练500亿token;第三阶段,用高质量长上下文数据将长度扩展到32K,让模型能处理更长的输入。
后训练阶段更是关键。为了打造一个既能逐步推理又能快速响应的混合模型,团队设计了四阶段训练流程:思维链(CoT)冷启动 → 基于推理的强化学习 → 思维模式融合 → 通用强化学习。

具体来说:第一阶段,用多样化的长思维链数据微调模型,覆盖数学、编程、逻辑推理和STEM问题,让模型具备基本推理能力;第二阶段,通过基于规则的奖励机制扩大强化学习计算资源,增强模型的探索和利用能力;第三阶段,在长思维链数据和指令微调数据上联合微调,将非思考能力无缝融入思考模型;第四阶段,在超过20个通用任务上应用强化学习,包括指令遵循、格式遵循和Agent能力,进一步把模型调教得更全能。
从Qwen3的表现可以看出,通过扩大预训练和强化学习的规模,用更小的参数规模实现更高的智能水平,这条路完全走得通。混合思考模式的引入,也让开发者对模型预算的控制变得更加灵活。
展望未来,研发团队计划在几个方向上持续发力:优化模型架构和训练方法,进一步扩展数据规模、增加模型大小、延长上下文长度、拓宽模态,并通过环境反馈推进长期推理的强化学习。
一个不可忽视的趋势是,AI产业正在从"训练模型"转向"训练Agent"。大模型能力的实际应用价值,正在被一步步放大。通义大模型系列的目标,也正是围绕这个方向持续推进升级。
Ondo将于今日上线股票永续合约
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
新破天一剑太极刀任务攻略 破天一剑怎么取太极刀
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
区块链OTC交易所有哪几家比较正规?
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
合集38个项目筹集5.406亿美元 Figure融资2亿
AMD英特尔集体失眠!英伟达Rosa CPU搭载Rigel核:单核性能碾压x86
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
五菱星光L六座新能源SUV上市:三版可选,中配12.28
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
macOS 28将移除Rosetta 2兼容层,Intel应用面临运行危机
腾讯ima怎么创建共享知识库?
小鸡答题今天的答案是什么2026年7月9日
潜水员戴夫丛林DLC接吻的鱼任务攻略
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc