数码之家

 找回密码
 立即注册

QQ登录

只需一步,快速开始

搜索
查看: 69|回复: 0

[产品] Arm在Hot Chips 2026甩出AGI服务器CPU 136核Neoverse V3,844.8GB/s带宽,Xeon和Epyc遇硬茬

[复制链接]
发表于 3 小时前 | 显示全部楼层 |阅读模式
嘿,各位正在为下一代AI集群选型挠秃了头的系统架构师,你们是不是已经受够了x86平台那点可怜巴巴的内存带宽,每次跑大模型推理都得精打细算地把参数往显存里塞,稍不注意就爆了容量,还得跟老板解释为什么又要多买几十张显卡;各位每天蹲在数据中心机房盯着功耗表和空调温度、生怕电费超标被CFO叫去喝茶的基础设施运维负责人,你们是不是做梦都想找到一种既能堆算力又能把电费压下来的新路子,最好还能顺便让机柜里少冒点热气,让运维兄弟们夏天的命能好过一点;各位在阿里云、华为云、腾讯云、字节云这些大厂里负责硬件选型和供应链谈判的采购经理,你们是不是早就盼着市场上能多一个靠谱的服务器CPU玩家,好让Intel和AMD那两家别再那么有恃无恐地挤牙膏、抬价格,每次换代都只是频率涨一点点、价格涨一大截;各位搞深度学习框架调优和大模型分布式训练的一线算法工程师,你们是不是每次跑大规模训练任务时,都被跨节点通信延迟和内存瓶颈搞得心态炸裂,恨不得把服务器拆了重新设计,让数据搬运别再成为那块最短的木板;各位在金融量化交易、实时语音识别、自动驾驶感知这些对延迟极其敏感的行业里做技术选型的技术总监,你们是不是一直在寻找那种能把内存访问延迟压到100纳秒以内的狠货,好让自己的系统比别人快那么零点几毫秒,在高频交易的毫秒必争里多赚一杯羹;各位关注半导体产业链和芯片设计趋势的券商分析师和投资人,你们是不是也在盯着Arm在服务器市场的一举一动,想知道这家在手机芯片领域称王称霸的英国公司,到底能不能在数据中心这块硬骨头上啃下一大口,给二级市场讲出新的故事;各位整天泡在Chiphell、知乎、B站各种硬件评测区里的DIY发烧友和极客玩家,你们虽然暂时买不到这些企业级怪兽,但肯定也好奇这玩意儿到底有多猛,能不能让以后的桌面级ARM处理器也跟着沾光、性能起飞,让自己装机时多一个除蓝厂绿厂之外的第三种选择;就连那些只是偶尔刷刷科技新闻、对芯片大战略知一二的普通网友,你们是不是也觉得光看Intel和AMD两家来回打架有点审美疲劳了,正等着一个新面孔入场来点刺激的剧情,好让茶余饭后多点谈资,在朋友圈转发时能甩出点别人不知道的硬货。不管你是属于上面哪一类人,不管你是因为工作刚需还是纯粹的技术好奇心点开了这篇文章,今天要聊的这个事儿,绝对值得你放下手头的活儿,好好琢磨几分钟。

把时间锚点拉到2026年8月27日。就在前一天,也就是2026年8月26日,海外科技媒体Notebookcheck发布了重磅报道;而往前再追一天,2026年8月25日,Techpowerup、新浪科技等国内外媒体已经抢先披露了Arm在Hot Chips 2026大会上亮出的这款全新服务器处理器,代号AGI。注意啊,这个AGI可不是那个动不动就要毁灭人类的通用人工智能,而是Arm自己给这颗芯片起的名字。但你说巧不巧,这名字取得也太应景了,仿佛就是在暗示,这东西天生就是为AI时代量身打造的。这颗芯片一亮相,直接就把服务器CPU的核心数天花板给捅了个窟窿,最高能堆到136个核心,而且它的目标也非常明确,就是要正面硬刚Intel的Xeon和AMD的Epyc系列,在这块被x86统治了几十年的地盘上,狠狠地撕开一道口子。Notebookcheck在8月26号的报道里把话说得很直白:AGI处理器最高配备136个Neoverse V3核心,支持6TB内存,内存带宽冲到844.8GB/s,专门为AI工作负载设计,预计再过几个月就要开始商业出货了。而Arm官方产品页早在2026年3月25日就发布了AGI CPU的预览信息,并在这次Hot Chips 2026上给出了完整的产品简报。

咱们先把目光拉回到整个事情的起点。根据多家媒体在2026年8月25日至26日期间的连续报道,Arm公司在Hot Chips 2026大会上向外界详细披露了这款酝酿已久的服务器处理器。这款芯片的官方名称就叫AGI,至于AGI到底代表哪几个单词的全称,Arm在新闻稿里并没有给出官方的解释,大家记住AGI这个代号就行了,没必要纠结那几个字母。这可不是一款普普通通的迭代升级产品,它是Arm成立36年来第一款真正意义上的自研芯片,专门针对现代数据中心里最吃硬件、最考验性能的那些AI工作负载从头设计。说得直白一点,Arm这回是真的动真格的了,不再是以前那种小打小闹地在服务器市场边缘试探,而是直接掏出了一款规格拉满、野心勃勃的产品,摆明了要在Intel和AMD最核心的利润池子里插上一脚,同时也标志着Arm从一家技术IP授权方,转变成直接与AMD、Intel竞争的标准CPU供应商。根据Arm官方透露的信息,这款AGI处理器目前进展顺利,预计在2026年下半年启动商业出货,初始客户出货在第四季度。也就是说,最快在2026年年底,我们就有可能看到搭载这颗芯片的服务器开始在各大云厂商的数据中心里跑起来了。这对于整个服务器CPU市场来说,绝对算得上是一个标志性的事件,意味着继亚马逊的Graviton系列、Ampere Computing的Altra系列等少数几家先行者之后,Arm阵营终于有一位真正的重量级选手下场了,准备跟x86阵营来一场硬碰硬的较量。

那么,这款名叫AGI的处理器,到底凭什么敢去挑战Xeon和Epyc这两位霸主呢?咱们得把它的硬件规格掰开来,一个一个地看清楚。首先,在芯片的物理设计上,Arm采用了当下高端服务器芯片普遍流行的Chiplet小芯片架构。AGI处理器内部主要由两颗相对独立的Chiplet组成,这两颗Chiplet都是交给台积电来代工的,使用的是台积电目前最先进的N3P制程工艺。N3P是属于台积电3纳米家族里的第三代成员,根据台积电公开数据,N3P在保持设计规则和IP兼容性的同时,能在同漏电下带来约5%的性能提升,或者在同频率下实现5%到10%的功耗降低,晶体管密度提升约4%。更重要的是,N3P依然使用FinFET晶体管结构,台积电的GAA纳米片技术要等到N2节点才会引入,而N2在2025年第四季度才进入量产。这意味着Arm在底层制造技术上,已经追上了Intel和AMD的步伐,站在了同一个起跑线上。AGI处理器总共会有三个不同的版本推向市场,分别是64核心、128核心和顶配的136核心版本,对应的SKU编号分别是SP113012A、SP113012S和SP113012。这三个版本的核心频率范围设定在2.8GHz到3.7GHz之间,其中136核和128核版本的睿频上限为3.5GHz,而64核版本因为核心数少、散热压力小,睿频可以冲到3.7GHz。这是一个相当稳健的频率区间,既保证了足够的单核性能,又不会因为盲目追求高频而导致功耗和发热失控。根据芯智讯等媒体的详细拆解,AGI的每个Chiplet物理上包含超过500亿个晶体管,完整芯片的晶体管总数突破了1000亿颗。这里有个很有意思的小细节,Arm在设计这两个Chiplet的时候,每个Chiplet物理上其实集成了整整70个Neoverse V3核心。也就是说,两个Chiplet加起来一共是140个核心。但为什么最终顶配版本只标了136个核心呢?原因很简单,就是为了提升良品率。在半导体制造过程中,一片晶圆上切下来的芯片不可能个个都是完美的,总会有个别核心存在瑕疵。Arm的做法是,在每个Chiplet上预留了4个冗余核心,在顶配的136核心版本中,实际上是从每个Chiplet的70个核心里分别屏蔽掉2个有缺陷的核心,从而得到两个拥有68个好核心的Chiplet,加起来正好是136个核心。这种通过屏蔽部分核心来提升有效良率的做法,在芯片行业里是非常成熟和常规的操作,AMD、Intel也都是这么干的。这样一来,Arm就能把那些原本因为个别核心缺陷而要报废的芯片重新利用起来,大大降低了生产成本,也让客户能够买到更多合格的产品。

接着往深处挖,咱们来看看AGI处理器的核心架构和缓存设计。它所采用的Neoverse V3核心,本身就是Arm面向基础设施市场推出的高性能微架构,代号Poseidon,是V1(Demeter级,用于Graviton 3)和V2(Demeter+级,用于Graviton 4和Grace)的继任者。每一个Neoverse V3核心内部,都集成了两个128位的SVE2向量引擎。这两个向量引擎是干什么用的呢?简单来说,它们就是专门用来加速AI推理、科学计算和数据处理这类并行计算任务的。不管是跑神经网络模型里的矩阵乘法,还是做大数据分析里的向量化操作,这两个128位的SVE2向量引擎都能派上大用场。除了向量引擎之外,每个核心还独享高达2MB的二级缓存,L2的加载到使用延迟为10个周期,传输能力为128字节/周期。2MB的L2缓存对于单个核心来说已经是一个非常充裕的容量了,能够有效减少核心访问主内存的次数,降低延迟。而在整个处理器层面,根据Arm官方产品简报,AGI提供了128MB的系统级缓存(SLC)。需要注意的是,早期媒体在报道时曾提及"最高272MB的系统级缓存",但Arm官方产品页明确写的是128MB SLC,本文以官方口径为准。这个系统级缓存是所有核心共享的,它的作用就像一个巨大的数据中转站,可以把那些经常被多个核心反复访问的热点数据暂存起来,避免它们频繁地去读写速度较慢的DDR5内存。这套从核心私有缓存到共享系统缓存的层级结构,设计得非常用心,目的就是为了尽可能缩短数据通路,让核心在处理AI任务时,能够更快地拿到所需的数据,不至于因为等待数据而空转。

再细看Neoverse V3的微架构细节,这颗核心的前端采用10路指令提取和10路解码,重命名与分发单元拥有超过384个条目的乱序执行窗口,支持10路分发和8路提交。它还配备了64KB指令缓存和64KB数据缓存,分支预测单元采用TAGE级别预测器。这种宽前端、深乱序窗口的设计,让V3在指令级并行能力上直接对标当代x86的高性能P-core。浮点和向量端每个周期最多执行4条ASIMD或SVE浮点FMA指令,单精度浮点峰值性能为每周期32 FLOP,双精度为每周期16 FLOP。这种计算能力,配合bfloat16和INT8的AI指令支持,让AGI在跑大模型推理时的矩阵运算效率有了底层保障。

接下来,咱们重点聊聊AGI处理器里最核心、也是最亮眼的一个部分——它的互联架构和内存子系统。刚才提到了,AGI由两个Chiplet组成,这两个Chiplet之间是怎么通信的呢?答案是UCIe,也就是Universal Chiplet Interconnect Express,这是一种开放的、业界标准的Die-to-Die互联标准。AGI的两个Chiplet之间通过16×16的UCIe宏相连,数据传输速率达到了32GT/s,也就是每秒32G次传输。这两个Chiplet之间的聚合带宽,高达2TB/s。这是一个什么概念呢?根据UCIe技术规范,16通道的UCIe链路在32GT/s速率下,单向带宽就是64GB/s,双向合起来128GB/s;而AGI用的是16×16的UCIe宏阵列,聚合带宽冲到2TB/s,相当于在封装内部修了一条无比宽阔的数据高速公路,两个Chiplet之间交换数据几乎没有什么瓶颈。而且,Arm在这里做了一个非常聪明的设计,这也是AGI与AMD、Intel、Nvidia采用分离计算与I/O的多芯片异构设计最大的不同点。AGI的每一个Chiplet都不是一个半残废的模块,而是一个五脏俱全的独立个体。什么意思呢?就是说,每一个AGI的Chiplet里面,都完整地包含了属于自己的CPU核心、自己的内存控制器、以及自己的I/O输入输出组件,Arm选择了高度集成的SoC方案,将计算单元和I/O集成在同一裸片上。这就带来了一个巨大的好处:当一个核心想要访问它所在的这个Chiplet本地所连接的内存时,数据请求完全不需要跨过Chiplet之间的那条UCIe互联通道。数据直接在本地就被处理掉了,根本不用跑到隔壁Chiplet那里去绕一圈。这样一来,就极大地降低了内存访问的延迟。Arm官方给出的数据是,对于本地内存的访问,AGI处理器能够将DRAM内存访问延迟控制在100纳秒以内。100纳秒是什么水平?对于服务器CPU来说,这是一个非常优秀的数字。要知道,在很多对延迟极度敏感的AI应用场景里,比如在线推荐系统、实时语音识别、高频交易等,内存访问延迟每降低一点点,都可能带来用户体验或者业务收益的巨大提升。AGI能做到这一点,对于那些被延迟问题困扰已久的开发者来说,绝对是一个天大的好消息。芯片内部还通过8×9的CMN-S3低延迟互连网格连接CPU核心、内存、I/O和加速器,系统内包含128MB分布式系统级缓存及嗅探过滤功能。

说到内存,这绝对是AGI处理器身上最耀眼的强项之一,也是它敢于叫板x86对手的最大底气所在。咱们来看具体参数。前面说了,AGI有两个Chiplet,而每一个Chiplet都集成了一个六通道的DDR5内存控制器。两个Chiplet加起来,那就是十二通道的DDR5内存控制器。这十二个通道共同发力,最高支持DDR5-8800内存速率,能够为AGI处理器提供最高可达844.8GB/s的聚合内存带宽(这个数字是12通道×8800MT/s换算得出的理论峰值)。844.8GB/s!这个数字已经远远超过了目前市面上主流双路x86服务器的内存带宽。根据2026年中期的基准测试数据,AMD EPYC 9965(192核,12通道DDR5-6000)的可持续内存带宽约为60GB/s,Intel Xeon 6 6726P(28核,8通道DDR5-6400)约为42GB/s;而在双路服务器平台层面,EPYC的每路内存带宽约540GB/s,Xeon 6则是约500GB/s。AGI单路就做到了844.8GB/s,这种代差级别的优势是不折不扣的降维打击。更关键的是,AGI支持的DDR5内存频率直接拉到了DDR5-8800。DDR5-8800是目前企业级市场上能看到的最顶级的内存规格之一,频率越高,意味着数据传输的速度越快。而且,AGI的单个处理器插座,最大可以支持高达6TB的内存容量,每通道支持2根DIMM。6TB是个什么概念?你可以在一台单路服务器上,插满高密度内存条,把整个大型语言模型的参数全部加载到内存里,然后让CPU直接在上面做推理计算,连GPU显存都不需要了。这种恐怖的内存容量和带宽支持,对于那些正在做大模型推理服务、需要处理超大知识图谱或者海量实时数据的公司和研究机构来说,简直就是梦寐以求的神器。除了单纯的容量和带宽大,Arm还在AGI的内存控制器里内置了一套智能的流量优先级管理和争用控制机制。这套机制的作用是什么呢?它可以动态地监控和调度来自不同CPU核心和不同I/O设备对内存的访问请求,允许系统设计师将CPU流量与I/O传输分开。比如说,当某个对延迟极其敏感的AI推理任务正在抢占内存带宽时,而另一个后台数据备份任务也想同时读取内存,AGI的内存控制器就会自动把更高的优先级分配给推理任务,确保它的延迟不会受到影响。这种精细化的管理能力,让AGI在处理混合负载时显得游刃有余,不至于因为某个任务抢占了太多资源而导致整个系统的性能雪崩。

在扩展能力方面,AGI同样没有落下。它为外部设备提供了多达96条的PCIe 6.0通道。PCIe 6.0是当前最新的PCIe标准,它的信号速率达到64GT/s,带宽是PCIe 5.0的两倍。这96条高速通道可以用来连接各种高性能的加速卡,比如GPU、FPGA、AI推理卡,或者高速网络适配器和NVMe固态硬盘。更重要的是,AGI还完整支持CXL 3.0协议,具体来说是CXL 3.0 Type 3。CXL 3.0是一种建立在PCIe物理层之上的高速互联协议,它最大的作用就是允许CPU、内存和加速器之间实现缓存一致性共享。有了CXL 3.0 Type 3的支持,服务器就可以通过CXL接口挂载额外的内存扩展池,从而实现内存容量的进一步弹性扩容,这正是可组合AI系统所需要的。这对于那些需要处理超大数据集的数据库和AI应用来说,又是一个极具吸引力的特性。除了CXL 3.0和PCIe 6.0,AGI还提供了AMBA CHI Extension Link用于加速器挂载,另外保留了6条PCIe 4.0控制通道,以及I3C、I2C和SPI这些用于低速设备管理和控制的传统接口。在功耗方面,AGI处理器的热设计功耗,也就是TDP,设定在了300瓦。300瓦的TDP对于一款拥有136个高性能核心、12个DDR5内存通道和96条PCIe 6.0通道的服务器CPU来说,其实是一个非常合理的数字。它既没有为了极致性能而不顾功耗,也没有为了低功耗而过度牺牲性能,可以说是在性能和能效之间找到了一个不错的平衡点。值得一提的是,AGI不支持同步多线程(SMT),每个核心只有一个线程,Arm的产品管理团队明确表示,他们特意不想添加那些在设备使命中不能被100%利用的功能,这种"做减法"的设计哲学,与Intel和AMD维护几十年x86软件向后兼容性的思路形成了鲜明对比。

现在咱们把视野放大到整机和机架层面,看看AGI的密度能做到什么程度。Arm官方给出的参考设计是1U 2节点的OCP标准DC-MHS形态,每1U可以提供272个高性能专用核心,采用气冷设计以适配标准基础设施。在36kW气冷ORv3机架部署目标下,可以塞入30个1U服务器,每个服务器配两个AGI CPU,合计8160个高性能CPU核心。这是什么概念?一个标准机柜,光是CPU核心就有8160个,而且还是气冷的,不需要复杂的液冷基础设施。如果是液冷配置,在200kW的机架上,Arm已经验证了可以达到45696个核心的密度,这超过了NVIDIA Vera机架密度的两倍。对于数据中心运营商来说,这种核心密度意味着同样的面积、同样的功耗,可以跑更多的AI推理任务,TCO(总体拥有成本)的优势是碾压级的。

那么,Arm推出这款AGI处理器,到底是瞄准了哪些具体的应用场景呢?答案其实已经很明确了。Arm官方在发布时就毫不掩饰地表示,AGI主要是为AI服务器和所谓的Agentic AI系统量身打造的。Agentic AI指的是那种具备自主感知、决策和执行能力的AI代理系统,这些系统能够持续运行、实时决策,需要在分布式基础设施中协调数千个并行任务。这类系统对计算资源的需求非常特殊,它们不仅需要强大的算力来处理复杂的模型推理,更对内存带宽和内存访问延迟有着近乎苛刻的要求。因为在Agentic AI的工作模式下,AI代理需要不断地与环境交互、检索知识库、调用工具,每一步操作都可能伴随着大量的数据读写。如果内存带宽不够,延迟过高,AI代理的反应就会变得迟钝,无法胜任实时性要求高的任务。Arm声称,基于AGI处理器构建的服务器,在与使用现代x86处理器的同等配置服务器进行对比时,能够在同样的机架空间内,提供高达两倍的性能输出。当然,Arm自己也承认,这个两倍的数据是基于他们内部的估算得出的,并不是经过第三方独立测试机构认证的结果,在Arm官网的产品简报脚注里也明确标注了这一点。所以我们在看待这个数字时,还是要保持一份理性的期待。不过,即便打个对折,如果真的能在相同功耗和空间下实现50%甚至更高的性能提升,那对于数据中心运营商来说,就已经是一个足以让他们认真考虑更换平台的巨大诱惑了。

从更宏观的视角来看,AGI的发布,标志着Arm在服务器市场的征途上,又迈出了极其坚实的一步。长期以来,服务器CPU市场一直被Intel的Xeon和AMD的Epyc所主导,x86指令集架构在这个领域建立起了近乎牢不可破的生态壁垒。尽管这些年也有不少基于Arm架构的服务器芯片尝试发起冲击,比如亚马逊的Graviton系列、Ampere Computing的Altra系列,它们都在特定的云原生场景下取得了不错的成绩,但从市场整体份额来看,依然无法撼动x86的统治地位。而Arm这次推出的AGI,无论是在核心规模、内存带宽、互联架构还是制程工艺上,都展现出了完全不输于同期顶级x86处理器的实力。它不再是一款只能在特定场景下充当绿叶的配角,而是一款真正有潜力成为数据中心主角的旗舰级产品。随着AGI在2026年下半年正式进入商业出货,我们有理由相信,2026年下半年到2027年,服务器CPU市场的竞争将会变得前所未有的激烈。Intel和AMD肯定会感受到实实在在的压力,被迫加快产品迭代的速度,拿出更有竞争力的产品来应对Arm的挑战。而对于我们这些最终用户和消费者来说,这种竞争无疑是一件大好事。更多的选择意味着我们可以根据自己的实际需求,挑选到性价比更高、更适合自己业务的服务器硬件。也许在不久的将来,当你打开某个云服务商的后台,创建一个新的云服务器实例时,选项列表里除了Intel和AMD之外,还会多出一个来自Arm的、性能强悍的新选择。

这里有必要单独聊聊AGI背后的商业逻辑和首发客户。根据公开报道,2026年3月,Arm宣布与Meta达成深度合作,双方将联合开发多代面向数据中心与大规模AI部署的全新CPU,而AGI就是双方合作的结晶,Meta不仅是首发客户,也是联合开发者。这个合作的意义非同寻常——它意味着AGI不是Arm闭门造车做出来的实验品,而是从源头就按照全球最大AI基础设施运营商之一的真实需求定制的。Meta目前每年在资本支出上的投入高达1150亿到1350亿美元,如此规模的采购体量,足以让AGI在量产初期就获得稳定的订单基本盘。对Meta来说,AGI的设计理念与它自研的MTIA加速器(一系列与博通合作开发的RISC-V推理芯片,目前已发展到第四代)形成互补,AGI负责协调和管理,MTIA、以及来自NVIDIA和AMD的GPU负责具体的矩阵运算加速。这种"Arm CPU + 专用加速器"的组合,正在成为超大规模数据中心的新范式。

更值得关注的是Arm在AI服务器主机CPU市场的既有地位。根据Arm官方在Hot Chips 2026上披露的数据,Arm已经向数据中心交付了15亿个Neoverse核心,其中5亿个是在过去九个月内完成的,目前Arm在AI服务器平台主机CPU市场的份额已经超过60%,云端部署Arm架构的企业数量突破12万家。Arm预测,到2030年,AI智能体的令牌使用量可能增长24倍。这组数字说明,AGI不是从零开始抢市场,而是在Arm已经占据的AI服务器主机CPU版图内,把产品形态从"IP授权给合作伙伴"升级为"Arm自己下场卖芯片"。这种战略转身,对Intel和AMD的威胁远比单纯的市场份额数字更深远——它意味着x86阵营失去的不仅是几个百分点的市占,而是整个AI基础设施底层架构的话语权。

从技术路线的角度看,AGI最颠覆行业认知的,是它对传统Chiplet设计范式的反转。过去几年,AMD、Intel、Nvidia在 Chiplet 化时,普遍采用"计算Chiplet + I/O Chiplet"的分离方案——计算die用最先进的制程狂堆核心,I/O die用成熟制程集成内存控制器和PCIe控制器。这种做法的好处是计算die面积可以做得比较小,良率高;缺点是内存访问必须跨越die-to-die互联,延迟下不来。AGI反其道而行之,把计算、内存控制器、I/O全部集成到同一个Chiplet上,两个Chiplet各自是一个完整的SoC。这种设计让本地内存访问完全不需要跨UCIe,从而实现了低于100纳秒的DRAM延迟。代价是每个Chiplet的面积都很大(500亿+晶体管),对良率是不小的挑战,所以Arm才在每个Chiplet上预留4个冗余核心来提升有效良率。这是一次典型的"用设计复杂度换性能天花板"的豪赌,从目前披露的参数看,这场赌局Arm赢得很漂亮。

再把视线拉回到x86这边,看看AGI到底动了谁的奶酪。Intel当前的Xeon 6平台分两条产品线:Granite Rapids(P-core,最高128核/颗,8通道DDR5)和Sierra Forest(E-core,最高288核/颗,8通道DDR5),两者都支持PCIe 5.0和CXL 2.0。AMD的EPYC Turin(Zen 5)最高192核/颗,12通道DDR5-5600,PCIe 5.0+CXL 2.0。从纸面参数对比:AGI的136核虽然不如EPYC Turin的192核和Sierra Forest的288核,但AGI的12通道DDR5-8800带来了约844.8GB/s的内存带宽,而双路EPYC Turin约540GB/s,双路Granite Rapids约500GB/s,AGI单路的带宽就已经大幅领先双路x86平台。再加上AGI支持的是PCIe 6.0和CXL 3.0,比x86阵营的PCIe 5.0和CXL 2.0整整领先一代。更关键的是每核心内存带宽:AGI的136核版本每核6GB/s,128核版本每核6.3GB/s,64核版本因为核心少每核能分到13GB/s;而EPYC Turin在12通道DDR5-6000下,每核带宽被192个核心摊薄到约3.1GB/s。对于AI推理这种memory-bound的工作负载,每核内存带宽的差异直接决定了推理吞吐的高低。这就是为什么Arm敢喊出"每机架性能超过x86两倍"的底气所在——它不是靠堆更多核心,而是靠每核心能喝到更多内存带宽、用更新的I/O标准、在同样300W TDP下挤出更高的有效算力。

当然,咱们也得冷静地看到,Arm自己说的"机架性能可达现代x86两倍"目前还只是Arm内部的估算,不是第三方独立测试跑出来的硬数据。这颗芯片到底在实际业务负载里能发挥出几成功力,还得等2026年底或者2027年初商用出货之后,看那些头部云厂商拿到货实测的结果。另外,x86阵营也不会坐以待毙,Intel和AMD手里都还有牌没出——AMD的Zen 6 EPYC预计2026年发布,要突破256核/颗;Intel的Xeon 7(Diamond Rapids)聚焦更高IPC和DDR6/CXL 3.0支持。未来的服务器CPU市场注定是一场旷日持久的恶战。但不管仗怎么打,Arm AGI的发布已经把一个明确的信号传递给了整个行业:服务器CPU市场的游戏规则,从2026年8月26号这一天起,正式进入了三足鼎立的新篇章。

还有一点不得不提,AGI的软件生态适配其实比很多人想象的要成熟。因为AGI基于Armv9.2指令集,支持bfloat16和INT8的AI指令,而Arm的Neoverse平台已经有多年生态积累。编译器层面,LLVM 18+和GCC 14+都已经能产出高质量的SVE2代码;运行时层面,OpenJDK 21和24的Vector API、.NET 9、Go 1.22+、现代Rust都能在热路径上自动发射SVE2序列;AI框架层面,Arm的KleidiAI调优库已经把SVE2-aware的GEMM内核集成进了PyTorch和ONNX Runtime。这意味着开发者和企业用户在迁移到AGI平台时,不需要从零开始重写代码,大部分现代云原生和AI基础设施软件栈都能在AGI上直接跑起来。这种"硬件新品但软件不新"的平滑过渡能力,是Arm相比于其他新兴架构(比如RISC-V服务器)最大的隐形优势。

回过头再细细品味从2026年8月25日到26日这两天密集发布的AGI报道,你会发现Arm这次亮剑的分量有多重。一颗最高136核心、844.8GB/s内存带宽、6TB内存支持、300瓦功耗、UCIe 32GT/s互联、96条PCIe 6.0通道、CXL 3.0支持的服务器CPU,每一个数字单拎出来都够写一小段,把它们全部塞进同一颗芯片里,这就是Arm交出的答卷。Notebookcheck作为海外一家在硬件圈口碑扎实的科技媒体,选择在2026年8月26号这个时间点把AGI的细节抖出来;芯智讯、新浪科技等国内媒体则在8月25号就率先披露了关键信息——这种国内外同步热炒的盛况,本身就说明了业界对这款产品的关注度已经到了沸点。对于正在为AI基础设施选型的技术决策者来说,AGI的出现意味着x86不再是唯一的答案,市场第一次有了一个在内存带宽这种AI时代最关键指标上反超x86的严肃选项。对于投资人来说,Arm从一家靠授权IP收租的公司,转变成直接下场卖芯片的玩家,这个战略转身的意义怎么估量都不为过,AGI就是Arm递交的第一份成绩单,而Meta的百亿美元级资本支出就是这份成绩单最早的背书。对于普通技术爱好者来说,看着服务器CPU从双位数核心一路卷到三位数核心,看着内存带宽从GB/s级别卷到844.8GB/s,这种技术进步的速度本身就足够让人热血沸腾。

当然,咱们也得冷静地看到,Arm自己说的"机架性能可达现代x86两倍"目前还只是Arm内部的估算,不是第三方独立测试跑出来的硬数据。这颗芯片到底在实际业务负载里能发挥出几成功力,还得等2026年底或者2027年初商用出货之后,看那些头部云厂商拿到货实测的结果。另外,x86阵营也不会坐以待毙,Intel和AMD手里都还有牌没出,未来的服务器CPU市场注定是一场旷日持久的恶战。但不管仗怎么打,Arm AGI的发布已经把一个明确的信号传递给了整个行业:服务器CPU市场的游戏规则,从2026年8月26号这一天起,正式进入了三足鼎立的新篇章。各位搞技术的、搞投资的、搞运维的,不妨把这颗AGI处理器盯紧了,看看它到底能不能兑现Arm夸下的海口,真正搅动这片沉寂了太久的服务器江湖,也看看Intel和AMD会拿出什么样的反击招式来守住自家饭碗。这场从移动端蔓延到数据中心领域的架构之争,好戏才刚刚开始,而台下的我们,既是观众,也是这场技术变革的最终受益者。









本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

x
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

APP|手机版|小黑屋|关于我们|联系我们|法律条款|数码之家-技术知识分享平台

闽公网安备35020502000485号

闽ICP备2021002735号-2

GMT+8, 2026-8-27 14:00 , Processed in 0.078000 second(s), 7 queries , Gzip On, Redis On.

Powered by Discuz!

© MyDigit.Net Since 2006

快速回复 返回顶部 返回列表