来源:互联网 更新时间:2026-07-02 14:36
在提升大模型生成效率的赛道上,英伟达最近给出了一个值得关注的新思路。7月1日,这家公司正式开源了其最新推出的Nemotron扩散语言模型——「双塔」架构(Nemotron-Labs-TwoTower)。简单说,这个模型的核心目的,就是用架构创新去打破传统自回归(AR)模型长期以来面临的吞吐量瓶颈。
传统自回归模型生成文本时,是一个token一个token串行解码的,就像排队过安检,一个一个来。碰上大规模合成任务,这种逐字推进的方式效率就会拖后腿。英伟达的解法是:把任务拆成两路并行处理。一路是「上下文塔」,它保持冻结状态,专门负责处理提示词,守住原有的语言理解能力;另一路是「去噪器塔」,经过专项训练,专门用来并行生成并优化token。两塔各司其职,互不干扰。
这种设计的精妙之处在于,它在「质量」和「速度」之间找到了一个不错的平衡点。在2×H100 GPU的评测环境下,该模型在默认设置下成功保留了基线模型98.7%的生成质量,而实际生成吞吐量却直接翻了2.42倍。这意味着什么?对于需要批量生产合成文本的数据团队来说,这简直是一把兼具高性能与高效率的利器——省时,还不怎么掉品质。
具体到使用层面,这个模型也够灵活:它支持扩散模式、模拟AR和标准AR三种解码方式,开发者完全可以按任务需求自由切换。目前该模型已经以开放权重项目的形式发布,遵循NVIDIA Nemotron开放模型许可协议,并且完全支持商业用途——这一点对很多团队来说无疑是加分项。
当然,新东西总有些妥协。比如在代码生成和数学推理任务上,它相比原始基线有轻微的性能回落,同时对GPU显存也有一定要求。但瑕不掩瑜,它为大模型推理加速提供了一个极具潜力的技术方向。可以预见,随着人工智能应用向高频、大规模场景渗透,这种通过算法架构优化来换取生成速度的思路,正在成为模型研发的新趋势——甚至可能是下一轮竞争的胜负手。
Ondo将于今日上线股票永续合约
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
区块链OTC交易所有哪几家比较正规?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
AMD英特尔集体失眠!英伟达Rosa CPU搭载Rigel核:单核性能碾压x86
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
异环伊洛伊阵容怎么搭配
《探索流放之路物品等级的奥秘》 揭秘物品等级的效果和怎么查看
新破天一剑太极刀任务攻略 破天一剑怎么取太极刀
潜水员戴夫丛林DLC接吻的鱼任务攻略
电视剧《白领公寓》剧情介绍
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
Windows环境下Claude Code从C盘迁移至D盘的完整操作教程
华为Mate 70系列首发的红枫镜头下放至千元档:全员普及原色影像
币安投票上币与下币机制解析:买票争议与规则边界
合集38个项目筹集5.406亿美元 Figure融资2亿
逆战未来s3出什么新角色 逆战未来S3赛季新角色爆料
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc