来源:互联网 更新时间:2026-07-07 14:59
先说说最近的一个大新闻:腾讯混元正式开源了他们的Hy3模型。如果你关注过大模型圈子,可能会对MoE(混合专家)架构不陌生。Hy3是一个295B参数的MoE模型,规模不小,但也有意思的是,它的激活参数只有21B,算下来实际调度成本并不高。
这款模型在Agent能力、推理和长上下文任务上的进步非常明显。有多项基准测试显示,它的表现已经能与参数规模大2到5倍的旗舰模型一较高下。更值得留意的是,通过强化后训练和精细的数据清洗,Hy3的幻觉率从12.5%降到了5.4%,常识错误率也从25.4%降到了12.7%。这意味着,在回答内容可靠性和用户信任感上,它确实比多数同尺寸模型更有底气。
在实际应用层面,Hy3已经覆盖了代码开发、办公自动化、前端设计等多个生产力场景。至少从公布的数据来看,它在性价比上算是一个相当可靠的选择。
那Hy3到底能干什么?我们可以从几个关键维度来看:
支撑这些能力的,是几个关键的技术优化方向:
如果你想亲自试试Hy3,操作路径很清晰:
归纳下来,Hy3的核心竞争力主要体现在四个方面:
既然是开源模型,自然免不了要和市场上的同类产品做个对比。这里就拿DeepSeek-V4 pro来做个参照,看看Hy3的定位是什么水平。
| 对比维度 | Hy3 | DeepSeek-V4 pro |
|---|---|---|
| 模型架构 | 295B MoE,21B 激活参数 | 671B MoE,37B 激活参数 |
| 开源协议 | Apache 2.0 | MIT(开源可商用) |
| SWE-bench Verified | 78.0 | 80.6 |
| Terminal Bench 2.1 | 71.7 |
64.0* |
| BrowseComp | 84.2 |
83.4 |
| MCP Atlas (public) | 79.1 |
73.6* |
| ClawEval (pass*3) | 68.5 |
58.4/62.1* |
| SkillsBench (text-only) | 55.3 |
40.5* |
| HLE (with tools, text-only) | 53.2 |
48.2 |
| AA-LCR | 73.4 |
71.3* |
从表格中可以看到,虽然Hy3的参数规模更小,但在多个关键基准上表现反而领先。尤其在Terminal Bench、MCP Atlas、ClawEval等智能体任务场景中,优势相当明显。这个结果传递出的信号是:模型能力的强弱,参数规模不是唯一的决定因素。
最后来看它适合用在哪些具体场景里:
Ondo将于今日上线股票永续合约
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
新破天一剑太极刀任务攻略 破天一剑怎么取太极刀
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
区块链OTC交易所有哪几家比较正规?
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
合集38个项目筹集5.406亿美元 Figure融资2亿
AMD英特尔集体失眠!英伟达Rosa CPU搭载Rigel核:单核性能碾压x86
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
五菱星光L六座新能源SUV上市:三版可选,中配12.28
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
macOS 28将移除Rosetta 2兼容层,Intel应用面临运行危机
腾讯ima怎么创建共享知识库?
全球首款AI智能体手机即将首秀!网友猜测或为豆包手机2代
小鸡答题今天的答案是什么2026年7月9日
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc