您的位置:首页 > > 教程攻略 > 热点新闻 >AI Innovators Adopt NVIDIA Vera — Why Max Single-Threaded CPU at Scale Matters
来源:互联网 更新时间:2026-07-08 10:39
7 月 7 日消息,

在智能体AI时代,一种全新的CPU分类正在浮出水面——大规模部署的极致单线程CPU。它专门为应对智能体系统的工作负载而生。
从智能体系统的构建到部署,CPU始终处于推理、响应时间和学习的关键路径上。它负责执行AI模型下达的指令:工具调用、代码执行、数据处理、KV缓存以及结果分析。对于AI工厂里的智能体来说,速度就是一切。
CPU运行工具的速度越快,智能体完成手头任务的速度就越快。而在AI工厂中,GPU的利用率是数据中心最宝贵的资源。一旦GPU因为等待CPU完成任务而闲置,每一秒浪费的都是AI工厂的营收——更糟的是,这会直接拉低GPU利用率。AI工厂需要一款具备极致单线程性能的CPU,来最大化营收和智能体性能。
可惜的是,今天的数据中心CPU并不是为“大规模高速”而设计的。虽然PC和工作站领域不乏高速CPU,但数据中心CPU的演进方向早已偏离了单线程性能。云计算时代的到来,推动CPU厂商不断堆高核心数、压低成本,代价就是牺牲了单核性能。
为了优化每租用核心的成本,厂商在芯片上塞进了更多核心,却削减了让核心跑得更快的硅片面积——比如高性能内存结构和更快的指令处理能力。转向小芯片架构进一步降低了成本,但也带来了“小芯片税”:每个CPU核心再也无法获得芯片全内存性能的访问能力。
AI智能体需要的,恰恰是一款专为大规模极致单线程性能而设计的CPU。这种CPU能够确保:在系统满载时,每个智能体步骤依然快速执行;每个核心都能以满性能完成智能体任务,不受其他核心干扰。大规模极致单线程CPU的设计思路截然不同,它必须交付:负载下强劲的单核性能、足够支撑每个核心的数据供给的内存带宽,以及可预测的延迟。每个核心都能独立完成任务,不被其他核心拖慢,从而在实现出色吞吐量的同时,更关键的是——让单核任务跑出最快速度。
NVIDIA Vera正是这一全新CPU设计理念的代表作。
AI智能体不会在单次请求后就停下来。它处在一个循环之中:模型推理下一步,CPU执行模型周边的运算,结果返回,模型决定下一步做什么,然后循环继续。这个模式对CPU的需求,传统CPU从未优化过。
传统CPU的工作是间歇性的、由用户驱动的,由人的交互触发短暂的调用。而智能体工作是持久且并行的:成群的智能体持续运行,每个智能体沿着一条链式步骤推进,每一步都依赖于前一步的结果。更多的核心意味着单个CPU能处理更多智能体任务,数据中心CPU确实需要大量核心来最大化任务吞吐量。
但是,增加核心数并不能缩短单个智能体循环中每一步的耗时。更多的核心无法让任何一个任务跑得更快。事实上,以最大化核心数为目标的CPU设计,反而会因为资源争抢而拖慢每个核心的性能。
单核性能才是决定每一步完成速度的关键。额外核心带来的吞吐量有用,但远远不够。由于每个动作都依赖前一个结果,单核速度决定了整个循环推进的快慢。最终,最适合智能体的CPU,必须拥有最好的单核性能,而且每个核心都必须在毫无妥协的情况下交付这种性能。世界以秒计数,而智能体以纳秒计数。NVIDIA Vera正是为这种全新类别的工作——以及这种速度——而生的。
NVIDIA Vera是一款大规模极致单线程CPU,从零开始为智能体循环设计——也就是模型调用之间发生的工作:智能体使用工具、处理数据、运行代码和检查结果。
Vera的核心是NVIDIA自研的Olympus CPU核心,每时钟周期指令数比上一代NVIDIA Grace提升了50%。这一点至关重要,因为许多智能体步骤是顺序执行的:一次工具调用、代码执行、测试运行或数据处理,必须完成后才能进入下一个模型调用。更快的核心,意味着每次循环都能更快地推进。
Vera将这些更快的核心与高达1.2TB/s的LPDDR5X内存带宽搭配,内存功耗不到40瓦,同时采用单片式计算die,确保活跃核心始终有数据供应,数据移动可预测,核心间带宽达到3.4TB/s,是其他任何数据中心CPU的3倍。这使得全部88个核心都能获得CPU的完整内存性能,而不会产生瓶颈拖慢每个核心。
结果就是更快的智能体循环。在代表智能体执行的负载测试中,Vera的持续单核性能是x86的1.8倍。这些增益在工具调用、代码执行、数据处理步骤和验证环节中层层叠加,帮助AI工厂在现有GPU上完成更多智能体工作。
Perplexity在日常运行的智能体工作负载上测试了Vera。在一个真实的编码工作流中——克隆仓库并在沙箱中运行测试套件——Vera比x86快了约1.5倍,同时启动并发沙箱的速度提升了1.9倍。Perplexity目前正计划在即将投产的系统中部署Vera。
智能体还高度依赖数据。它们需要不断查询、检索、过滤和移动信息,而Vera能更快地处理这些CPU端的数据负载。合作伙伴实测显示,在Starburst上运行的大规模SQL分析性能提升3倍,在Redpanda上的实时流处理延迟最高降低6倍——均与领先的x86服务器CPU对比。
智能体工作不是单一负载。它需要运行工具和沙箱、处理数据、服务请求,还要通过强化学习训练下一个模型——所有这些都依赖相同的CPU特性。一款Vera就能覆盖整个范围,无需为每种工作配备不同的CPU。而且,Vera正是NVIDIA Vera Rubin中托管GPU的那颗CPU,也是NVIDIA BlueField-4 STX存储处理器的基础,因此整个AI工厂可以运行在统一架构和同一工具链上。
NVIDIA的布局不止于此。下一代Rosa CPU将搭载Rigel核心,继续推进面向智能体AI时代的CPU路线图。Rigel是NVIDIA的下一代Arm v9.2 CPU核心,在保持相同硅片面积的同时,提供比Olympus更高的单核性能。关键改进包括更好的指令交付、更大的L2缓存和更高效的内存处理。
在智能体AI时代,将有数十亿个智能体。每一个智能体都需要CPU来执行动作、检查、检索、执行和验证。在这个新市场中,完成的智能体工作就是产品。更快的智能体循环,能让每一块GPU花更多时间创造营收,而不是等待。
NVIDIA Vera,正是为那样的未来而生的CPU。
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
腾讯ima怎么创建共享知识库?
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
区块链OTC交易所有哪几家比较正规?
2026热门直线加速赛车手游推荐:高人气、爽快加速体验的精品榜单
腾讯ima怎么把微信内容一键导入知识库?
kimi提示词专家使用方法新手指南
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
原神霜月三处月灵龛具体位置汇总
《幻兽帕鲁》不触发通缉捕捉传说商人方法
Windy卫星云图怎么看?云层变化识别技巧
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
为什么推特KOL都在BRC20赚钱 我一冲就亏?
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
一加手机如何设置三指长按屏幕局部截图
合集38个项目筹集5.406亿美元 Figure融资2亿
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc