数码之家

 找回密码
 立即注册

QQ登录

只需一步,快速开始

搜索
查看: 38|回复: 0

[科技] 88核Vera CPU细节曝光:NVIDIA这是要在服务器领域搞个大新闻?

[复制链接]
发表于 昨天 17:18 | 显示全部楼层 |阅读模式
本帖最后由 麻薯滑芝士 于 2026-7-22 17:20 编辑

嘿,各位大半夜还在盯着机房动环监控屏幕、生怕哪个温度传感器报警把你从被窝里薅起来的运维老炮儿,各位刚把一个大模型的推理管线调通、结果发现CPU成了拖后腿的那个短板、气得想摔鼠标的算法工程师,各位在公司季度采购会上为了多争取两台高性能服务器、跟财务总监从技术路线掰扯到投资回报率的IT负责人,各位家里攒了一堆至强或者霄龙处理器、就想看看NVIDIA这颗Arm芯到底有没有资格上机架的硬核垃圾佬,还有各位就是单纯喜欢围观科技巨头互相内卷、看谁先把谁的技术护城河给填平了的数码圈乐子人——今天这个礼拜三,也就是2026年7月22号,NVIDIA那边终于不再藏着掖着了,把他们那颗传闻已久的自研Arm架构CPU“Vera”的详细设计蓝图,摊在桌面上给大伙儿看了个清清楚楚。

根据科技媒体Techpowerup在今天发布的一篇报道,NVIDIA自己对这颗芯片的评价相当高,直接管它叫自家CPU工程领域的一座里程碑。这话从老黄嘴里说出来,分量可不轻。咱们不妨把时间轴往前拉一拉,回顾一下这件事儿的来龙去脉。其实早在去年,也就是2025年,圈子里就已经有风声说NVIDIA正在鼓捣自己的CPU了。你想啊,这几年AI浪潮席卷全球,NVIDIA靠着GPU赚得盆满钵满,但在数据中心这个大棋盘上,光有算力爆表的显卡是不够的,还得有一颗聪明的大脑来调度全局。以前这颗大脑要么是Intel的至强,要么是AMD的霄龙,但现在老黄显然不想再把命脉交到别人手里了,于是就有了这个代号为“Vera”的项目。按照NVIDIA官方的说法,这颗“Vera”CPU既可以无缝集成到他们自家的NVL机架系统里,跟Grace Hopper超级芯片或者其他GPU组件协同作战,也能作为一颗独立的服务器CPU单独拿出来卖。而且他们已经收到了不少企业客户抛来的橄榄枝,大家对在企业级环境里部署这颗自研CPU的兴趣,远比外界想象的要浓厚得多。

咱们先来聊聊这颗芯片最扎眼的硬指标:88个物理核心,借助超线程技术,总共可以跑出176个逻辑线程。你没听错,就是88个物理核,176个逻辑线程。这个数字放在当下的服务器CPU市场里,绝对属于最顶尖的那一小撮。但NVIDIA显然不是那种只会堆核心数量的愣头青,他们更在意的是这颗CPU到底擅长干什么。根据官方给出的定位,“Vera”CPU在设计之初就把目标对准了几个最吃性能的场景:海量数据分析、对单线程性能要求极高的任务、现在火得一塌糊涂的代理型人工智能,还有那些需要大规模软件并行运算的活儿。可以说,几乎把现代数据中心里最难啃的骨头都给涵盖了。

那么,这颗“Vera”CPU的内核到底长什么样呢?NVIDIA把它的核心架构命名为“Olympus”,并且清晰地划分成了四个主要的功能区域:前端、中核、执行引擎,还有缓存子系统。这四个部分各司其职,又紧密配合,咱们一个一个来拆开细聊。

先从最前面的前端说起。NVIDIA在这里设计了一个分支预测器,这玩意儿你可以把它想象成一个经验丰富的交通警察,站在CPU指令执行的十字路口。当程序遇到“如果怎么样就执行A,否则就执行B”这样的岔路口时,如果CPU傻乎乎地等条件判断结果出来了再行动,那效率就太低了。所以分支预测器的任务就是根据历史数据和算法模型,提前猜一个最有可能的方向,然后把那条路上的指令先准备好。NVIDIA做的这个分支预测器,是和指令获取单元紧密联动的,目的就是让核心永远有活儿干,别闲着。为什么这事儿这么重要呢?因为像代理运行时环境、编译器,还有那些处理海量数据的程序,它们的控制流变化特别频繁,动不动就要跳转到别的地方去执行。如果分支预测老是猜错,执行单元就得频繁地清空管道重新来过,这不就等于在白白浪费宝贵的计算资源嘛。为了解决这个问题,“Olympus”核心用了一个宽度达到10的解码引擎,啥意思呢?就是它每个时钟周期可以同时解码10条指令,确保执行单元面前始终有一条源源不断的指令流,让它们忙活得停不下来,利用率直接拉满。

为了给接下来的执行阶段铺好路,NVIDIA还搞出了一个听起来就很厉害的神经分支预测器。它的作用就是最大限度地减少CPU执行到错误路径上去的次数。这个神经分支预测器在每个时钟周期里,最多可以成功预测并处理两次分支跳转。这对于那些在处理大规模数据时,软件执行方向会突然发生剧变的控制流变化来说,简直就是一剂对症的良药。你想啊,在处理TB级别的数据集时,程序本来跑得好好的,突然因为一个数据特征触发了完全不同的逻辑分支,这时候要是没有一个足够聪明和果断的分支预测器,CPU就得停下来,把已经预取和预解码的错误指令全部扔掉,重新调整方向,那效率一下子就垮掉了。

接着咱们聊聊第二个区域,也就是“Olympus”核心的中核部分,或者叫重命名区。这个地方的设计思路相当巧妙,它的主要职责是在CPU的其他部分因为等待数据或者完成某个操作而不得不停下来的时候,去主动挖掘那些可以独立执行的隐藏任务。打个比方,就像一条汽车装配线上,某个工位的机械臂坏了,其他工位的工人不能也跟着发呆,得赶紧去找别的还能干的活儿。这里的重排序缓冲区就是干这个事儿的,它像一个勤劳的仓库管理员,不停地往里头装载那些已经准备好、可以随时拿去执行的指令。这样一来,乱序执行就能达到更深的程度。什么叫乱序执行呢?简单说就是CPU不再死板地按照程序写好的顺序一条一条地执行指令,它会像个精明的调度员一样,看哪个指令的先决条件已经满足了,就先把它丢给执行单元去处理。而重命名和分配映射表则负责把这些指令解码,并映射到对应的物理寄存器资源上。所有这些功能叠加在一起,就能最大限度地利用指令层面的并行性,让CPU始终保持高效率的生产状态,尤其是在那些软件工作流会突然发生变化、充满不确定性的场景里,这套机制的威力就体现得淋漓尽致了。

再来说说执行引擎这部分。当前端和中核把所有准备工作都做完了,指令也都安排得妥妥当当了,就该轮到执行引擎这个真正的“打工人”上场了。随着指令被分解成一个一个更小的微操作,每个微操作都会被精准地分配到对应的标量或者向量处理引擎里去。“Olympus”核心的执行引擎配备了一个动态调度器,这家伙的本事很大,它能以极低的延迟,把这些标量运算、向量运算、浮点运算、加密解密运算,还有加载和存储数据的微操作,迅速分发给对应的处理单元。这样一来,每秒钟能够处理的指令数量就得到了巨大的提升。不过有意思的是,NVIDIA并没有透露太多关于这部分的具体技术细节,按照业内的普遍猜测,这里头应该藏着他们最核心、最创新的技术机密,属于商业竞争中的杀手锏,暂时还不方便对外公开。可以这么说,这个执行引擎,很可能就是整个“Olympus”核心设计里含金量最高的地方。

最后,咱们来看看支撑整个系统高效运转的缓存子系统。这个部分的设计目标非常明确,就是要快,要能以最快的速度从CPU核心外面把需要的数据给“捞”回来。为什么要这么强调这一点呢?因为现在最折磨人的AI工作负载,特别是那种被称为“代理型AI”的应用,它们的胃口实在太大了。这类任务有个鲜明的特点:它们需要处理的数据量,远远超过了CPU内部那点可怜的三级缓存所能容纳的极限。这就意味着,CPU必须拥有极高的数据吞吐能力,才能把这些散布在内存各个角落的稀疏数据、庞大的数据库内容、不断变化的运行时对象、用于加速检索的索引,以及其他各种各样复杂的数据结构,给源源不断地搬运到核心内部来。为了解决这个棘手的难题,“Olympus”核心设计了一套层次非常深的缓存体系,还配备了多个智能预取引擎来提前预测并加载数据,甚至还有专门为处理图数据而设计的专用预取器。可以说,为了喂饱AI这个“大胃王”,NVIDIA在缓存这块真是绞尽了脑汁。

还有一个特别值得拿出来说道说道的地方,就是NVIDIA是怎么解决多线程环境里那个臭名昭著的“噪音邻居”效应的。用过传统x86 CPU的朋友都知道,很多x86处理器都支持同步多线程技术,说得通俗点,就是一个物理核心通过虚拟化技术模拟出两个逻辑核心来。但这种设计有一个天生的缺陷,就是这两个逻辑核心其实是在争抢同一个物理核心内部的资源,比如执行单元、缓存带宽等等。想象一下,两个人合租一间只有一张书桌的房间,一个人要写作业,另一个人要画画,那肯定得为谁用桌子、谁用台灯这种事情吵架。在现代高负载的计算环境下,这种资源竞争会导致其中一个线程因为拿不到足够的资源而发生停滞,严重拖累整体性能,这就是所谓的“噪音邻居”效应。NVIDIA是怎么解决这个问题的呢?他们的做法很巧妙,也很彻底。既然“Olympus”核心的内部宽度足够大,资源足够丰富,那干脆就在把资源分配给每个线程之前,先把这些资源给物理上划分好。也就是说,从一开始就给每个逻辑线程划定好了自己专属的地盘,从根本上杜绝了后面抢资源的可能性。这样一来,每个任务都能得到稳定且充足的执行资源,不会互相干扰,整个系统的性能和稳定性也就有了坚实的保障。

聊完了核心内部的设计,再来看看把整个CPU芯片串联起来的那张“神经网络”——NVIDIA的可扩展一致性互连架构。这个东西提供了高达3.4TB每秒的片内互连带宽,并且在CPU的裸片上集成了一个容量高达164MB的统一三级缓存。这164MB是个什么概念呢?比你市面上绝大多数家用电脑的 entire 内存还要大,相当于把一块超大容量的高速缓冲池直接放在了CPU内部。而在和外部内存通信方面,“Vera”CPU支持最新的SOCAMM2规格的LPDDR5X内存,聚合带宽达到了惊人的1.2TB每秒。NVIDIA表示,每颗CPU最多可以搭配1.5TB的LPDDR5X内存。1.5TB啊,这已经不是什么内存容量的概念了,这简直就是把一个微型数据库服务器的存储能力直接焊死在了CPU旁边。有了这么海量的高带宽内存,很多以前需要频繁访问硬盘或者SSD来进行数据交换的操作,现在可以直接在内存里头一步到位,速度的提升可不是一星半点。

最后,NVIDIA还放出了一些初步的性能对比数据来证明自己的实力。他们拿自家的“Vera”CPU跟去年,也就是2025年发布的AMD EPYC“Turin”9755处理器,在单核性能上做了一次正面交锋。根据NVIDIA公布的结果,在某些经过挑选的工作场景下,“Vera”CPU的单核性能最高可以达到对手的1.8倍。当然,我们心里都清楚,厂商公布的对比数据往往会选择对自己最有利的负载类型,但这依然无法掩盖这个数字背后的震撼力。要知道,AMD的EPYC系列多年来一直是服务器CPU市场的霸主,地位稳固得很。NVIDIA这颗初出茅庐的Arm架构CPU,竟然能在单核性能这个传统强项上实现对行业巨头的近乎翻倍的超越,这足以说明他们在CPU微架构设计上的功力有多么深厚。

总的来看,NVIDIA这次借着Techpowerup的报道放出的“Vera”CPU细节,可以说是干货满满,诚意十足。从88个物理核心、176个逻辑线程的豪华硬件配置,到神经分支预测器、10宽度解码引擎、智能动态调度器、深度缓存层级、资源分区多线程等一系列精妙绝伦的底层设计,再到高达1.5TB的内存支持能力和3.4TB每秒的片内互连带宽,每一项技术指标都精准地瞄准了当下以及未来几年AI计算和企业级关键应用中最让人头疼的痛点。虽然目前关于这颗CPU具体的上市时间、针脚定义以及最终售价,我们还一无所知,但从NVIDIA这次毫不吝啬地展示出来的技术肌肉来看,他们显然是做好了在服务器CPU这片红海里掀起一场腥风血雨的准备。对于我们这些坐在屏幕前的普通看客来说,虽然短期内大概率是摸不着也用不上这么顶级的玩意儿,但光是看着这些技术巨鳄们在最核心的赛道上互相较劲、你追我赶,就已经是一件足够过瘾、足够下饭的事情了。至于这颗承载着NVIDIA巨大野心的“Vera”CPU,最终究竟能不能像他们所期待的那样,成为撬动现有服务器市场格局的那根杠杆,咱们就搬好小板凳,沏上一壶茶,静静地等着看这场好戏怎么往下演吧。







本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

x
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

APP|手机版|小黑屋|关于我们|联系我们|法律条款|数码之家-技术知识分享平台

闽公网安备35020502000485号

闽ICP备2021002735号-2

GMT+8, 2026-7-23 01:13 , Processed in 0.140400 second(s), 7 queries , Gzip On, Redis On.

Powered by Discuz!

© MyDigit.Net Since 2006

快速回复 返回顶部 返回列表