来源:互联网 更新时间:2026-07-03 14:42
NVIDIA最近开源了一个很有意思的模型——Nemotron-Labs-TwoTower。它的总参数量大约60B,但靠MoE架构,实际活跃参数只有3B。这个模型最大的亮点,是把语言模型里的“上下文理解”和“去噪生成”这两个任务,拆给了两个独立的模块去干。一个叫上下文塔(Context Tower),专门处理干净的token,另一个叫去噪塔(Denoiser Tower),通过交叉注意力机制去精炼那些带噪声的token块。它基于Nemotron-3-Nano-30B-A3B构建,训练了约2.1T tokens,最终在保留自回归基线98.7%质量的前提下,生成吞吐量提升了2.42倍。它还支持Mask Diffusion、Mock-AR与AR-only三种推理模式,可以说是为高效推理而生。
git lfs或HuggingFace的transformers库下载模型权重和配置文件。requirements.txt)。AutoModelForCausalLM和AutoTokenizer加载模型,然后选一种推理模式(Mask Diffusion / Mock-AR / AR-only)就行。这里拿它和MIT的LLaDA做个简单对比,结果一目了然:
| 对比维度 | Nemotron-Labs-TwoTower | LLaDA |
|---|---|---|
发布机构 | NVIDIA | MIT |
架构设计 | 双塔分离 | 单塔统一 |
总参数量 | ~60B(活跃3B,MoE稀疏) | 8B(稠密) |
基座模型 | Nemotron-3-Nano-30B-A3B(Mamba-Transformer MoE) | 自研Transformer |
训练数据 | ~2.1T tokens | ~2T tokens |
基线质量保留 | 98.7% | ~95%(相对同等规模AR模型) |
吞吐提升 | 2.42× | ~1.5×(标准GPU环境) |
推理模式 | 三种 | 单一 |
注意力机制 | 上下文塔:因果注意力;去噪塔:双向块注意力 + 交叉注意力 | 统一双向注意力 + 位置编码处理 |
核心创新 | 角色解耦 | 简单 scalable |
七麦数据官网网页地址 七麦数据官方入口在线首页
问卷星官方网站入口地址 问卷星网页版在线使用
币安Binance官方中文网站 币安App最新版下载及新手注册指南
闲鱼的严选验货在哪里看?闲鱼严选和验货宝哪个可靠
PokePay加密卡2026完整指南:申请开卡全攻略+多场景应用技巧
淘宝直播如何看回放在哪里看?怎么查看淘宝直播回放
摩托车活塞环性能如何
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
豆包AI专业版使用教程【新手必看】
索尼限时赠送PS Plus Premium七日会员,需手
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
迷你网名古风男生霸气(精选100个)
文雅简易网名男生可爱(精选100个)
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
《梦幻西游》特殊鬼怪怎么抓-隐藏变异鬼应对要点
币圈十大实用工具:从实时行情监控到数据分析、资产管理
王者荣耀「西行封妖记」【孙权-仙扇使者】6月25日上线!
闲鱼严选和验货宝哪个可靠?闲鱼的验货宝怎么样,,
币安杀入美股市场,重头戏bStocks还没来
陈姓和杨姓网名大全男生(精选100个)
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc