来源:互联网 更新时间:2026-08-13 13:23
8 月 13 日消息,阿里云“魔搭 ModelScope 社区”公众号昨天(12 日)深夜宣布,阿里 Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重。

此次是 Qwen-Max 级别的模型首次开源权重:模型总参数为 2.4T,每个 Token 激活 95B 参数,原生支持 262,144 Token 上下文,并可扩展至 1,010,000 Token。
Qwen3.8 延续 Qwen3.5 的混合架构,重点提升编程、办公、科研和长周期 Agent 任务的端到端完成能力。最新云端版 Qwen3.8-Max 基于该开放权重模型,并加入更多生产环境能力。
最新公布的评测覆盖编程 Agent、通用 Agent、专业工作和长上下文等方向;与 Opus 4.8、Fable 5、GPT 5.6 Sol 等模型相比,各项结果互有高低,并在 PaperBench、IFBench 等 Benchmark 中取得所列模型中的较高成绩。
附上有关链接如下:
模型:https://modelscope.cn/models/Qwen/Qwen3.8-2.4T-A95B
blog:https://qwen.ai/blog?id=qwen3.8
Qwen Studio:https://chat.qwen.ai
Qwen3.8-2.4T-A95B 是一个因果语言模型,总参数为 2.4T,每个 Token 激活 95B。模型每个 MoE 层包含 512 个专家,每个 Token 选择 10 个路由专家,并同时激活 1 个共享专家。
模型还进行了多步 MTP(Multi-Token Prediction)训练,为支持相应机制的推理引擎提供预测多个后续 Token 的能力。
根据介绍,Qwen3.8-Max 的办公与 Agent 后训练概括为三个环节:
持续扩展真实环境,并在这些独立维度上解耦合:任务(Task)(单任务 → 多任务 → 跨天任务)、工作空间(Workspace)(多文件 → 层级目录 → 复杂异构目录)、Harness(不同的类别、版本、技能)。这样一来,环境数量就能顺着组合关系自然增长,而不是靠一个个定制集成硬撑出来。
构建一个统一的奖励系统,把真实任务里那些异构的验证方式,直接内化到体系中。这个系统覆盖了基于执行的校验、针对文本和渲染后视觉输出的 rubric 评估,以及 agentic 检查。换句话说,多种形式、多种模态被统一收拢进同一个奖励系统里,从而为所有环境提供一致、可靠的奖励信号,也顺手消除了维护任务专用 verifier 时不可避免的不一致问题。
构建一个在线数据均衡器,对每个 batch 进行重构,使其在任务、难度、工作区与 harness 上的分布高度均衡,降低 batch 间梯度方差,从而支撑强化学习的训练算力稳定、持续地扩展。
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
腾讯ima怎么把微信内容一键导入知识库?
腾讯ima怎么创建共享知识库?
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
2026热门直线加速赛车手游推荐:高人气、爽快加速体验的精品榜单
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
Windy卫星云图怎么看?云层变化识别技巧
kimi提示词专家使用方法新手指南
原神霜月三处月灵龛具体位置汇总
《幻兽帕鲁》不触发通缉捕捉传说商人方法
短剧《史上最强洪荒修为》剧情介绍
9条破亿视频,新号涨粉百万,过去半年谁在制造AI爆款?
为什么推特KOL都在BRC20赚钱 我一冲就亏?
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
炼金工房新作或能吃成“良子” 想让女主越吃越丰满
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc