来源:互联网 更新时间:2026-08-24 07:57
博主Alex Ziskind近期发布了一组本地人工智能推理性能对比测试结果,涉及两款高端设备:配备RTX 5090移动版显卡(24GB显存)的雷蛇灵刃18笔记本,以及搭载苹果M5 Max芯片、具备128GB统一内存的设备。
在中小规模语言模型(参数量为12B至35B)的常规推理任务中,RTX 5090展现出显著性能优势。以Gemma 4 12B模型为例,其推理速度达到4110 tokens/秒,比M5 Max的1762 tokens/秒高出约133%;在Qwen3.5 27B模型中,领先幅度达109%;即便在参数量达35B的Qwen3.6 35B A3B模型下,RTX 5090仍保持32%的速度优势。
然而,当测试进入超大规模模型或超长上下文场景时,格局出现显著变化。在Qwen3 4B模型搭配26万token上下文长度的测试中,RTX 5090因24GB显存容量的限制,推理速度骤降至25.28 tokens/秒;而M5 Max凭借其大容量统一内存,稳定输出速度达到181.40 tokens/秒,约为RTX 5090的近七倍。
同一硬件平台对上下文长度的敏感性也十分显著:当上下文扩展至68K token时,RTX 5090的处理速度可达160.36 tokens/秒;然而,当上下文进一步增加到262144 token时,由于受到显存物理上的限制,其吞吐量大幅下降84.2%,最终仅维持在21至25 tokens/秒的区间。
综合来看,若应用场景以高频、短文本生成为主,RTX 5090仍是更具效率的选择;但若任务涉及超长文档理解、多轮深度分析等对内存容量高度依赖的场景,则显存规模的重要性或将超越峰值算力本身。
腾讯ima怎么把微信内容一键导入知识库?
腾讯ima怎么创建共享知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
比特币 2025 年价格预测:BTC 的未来走势
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
WorkBuddy微信版怎么获得积分?
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
男生高性价比充电头?
博世壁挂炉关闭暖气怎么操作
5000元起的鼠标哪个最值得入手?
车载冰箱重置到出厂设置几步?
短剧《史上最强洪荒修为》剧情介绍
管线机怎么接云米净水器
结婚家电首选:Leader懒人三筒Ultra热泵洗烘一体
笔记本移动电源推荐哪款?
腾讯ima知识库怎么分类管理?
海尔消毒柜自动消毒如何中止
kimi提示词专家使用方法新手指南
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc