数码之家

 找回密码
 立即注册

QQ登录

只需一步,快速开始

搜索
查看: 54|回复: 0

[业界] 苏妈这回真下狠手!AMD Helios机架要把数据中心当整机造

[复制链接]
发表于 1 小时前 | 显示全部楼层 |阅读模式
嗨,各位每天泡在各种AI框架的文档里、为了把模型推理延迟从几十毫秒压到个位数而熬到凌晨两三点、连做梦都在调参的算法工程师和深度学习研究员,那些蹲在公司数据中心冰冷的地板上、一根一根地梳理高速铜缆和光纤、被几百台服务器散热风扇发出的高频噪音吵得脑瓜子嗡嗡作响、却还得掐着电费预算跟财务部门来回扯皮的IT基础设施负责人和数据中心运维主管,刚刚看完英特尔那份扭亏为盈的财报还没来得及把嘴合上、转眼又被AMD这场发布会砸得眼花缭乱的半导体行业分析师和二级市场投资者,那些正在评估下一轮算力采购到底该押注哪家平台、生怕选错了技术路线就被绑定好几年动弹不得的创业公司CTO和技术合伙人,以及那些不一定看得懂所有技术参数、但就是喜欢看苏姿丰博士穿着标志性的黑色外套站在聚光灯下、手里拿着最新款芯片露出那种自信从容微笑的科技爱好者——今天这篇文章跟你们每一个人都有着千丝万缕的关系,因为AMD的掌舵人苏姿丰博士,就在当地时间2026年7月23号这一天,在美国西海岸的旧金山,于一年一度的“Advancing AI 2026”大会上,当着台下密密麻麻的媒体记者、行业分析师和合作伙伴的面,一口气端出了两道分量极重的硬菜:一个是从头到尾重新定义了AI基础设施形态的机架级系统,名字叫Helios;另一个是第六代服务器中央处理器,代号Epyc Venice。这两个东西随便拿出哪一个来,都够科技媒体写上好几篇深度解读了,但苏妈偏偏选择在同一天的同一场主题演讲里把它们一起亮出来,这背后显然不是巧合,而是一套深思熟虑的战略布局。

苏妈走上讲台之后,没有像有些人那样先寒暄半天或者放一段炫酷的视频暖场,而是开门见山,直接点出了当前AI行业正在经历的一场根本性的范式转移。她说得很清楚:现在已经进入了智能体AI的时代,这个所谓的智能体AI,英文叫作agentic AI,跟过去那种你问一句它答一句、离开了预设脚本就不知所措的聊天机器人完全不是一个维度的东西。智能体AI的本质特征是,它能够自主地规划复杂的任务流程,自己判断在什么时候需要调用什么样的外部工具,然后一步一步地去执行和完成整个操作链条,整个过程几乎不需要人类进行干预和指挥。在这种全新的应用范式下面,评价一套AI系统的好坏,标准已经发生了彻底的改变——人们关注的焦点不再是一颗芯片的峰值算力有多高、浮点运算能力有多强,而是这颗芯片所驱动的整套AI基础设施在实际运行中的综合表现到底怎么样。苏妈直言不讳地说,AMD这一次是从一张干干净净的白纸开始,把整个设计方案彻底推倒了重来,目标只有一个:打造出一套拥有世界级效率的AI基础设施,而不是简单地堆砌硬件参数。

她特别着重强调了一个跟以往截然不同的设计理念,这个理念可以说是理解整场发布会的关键钥匙。她说,AMD彻底放弃了上一代那种把GPU、CPU、网络通信、供电系统和散热方案拆开来各自为政、独立优化的老路子,转而选择了一种前所未有的大一统方法——把整个数据中心当成一个单一的产品来对待和设计。这句话的分量有多重呢?让我给你解释一下。以前绝大多数硬件厂商的做法,基本上是各扫门前雪:做GPU的团队只管把浮点运算能力和显存带宽往死里堆,做网络的只管把互联带宽做大、把延迟做低,做供电的只管保证电压稳定,做散热的无非是多装几个风扇或者上水冷,大家各自为政,互不干涉,最后把所有部件拼到一起,能正常运行就算完成任务了。但AMD现在的做法完全颠覆了这套逻辑,他们从一开始就把所有这些组成部分放在同一个框架下进行统一的规划和调优,就好像在设计一台高度集成的完整设备一样,而不是东拼西凑地把现成的零件组装起来。苏妈对这个策略展现出了极强的信心,她说正是因为采用了这种系统级的设计方法,AMD现在才有能力向市场供应具备世界级效率的AI芯片。

苏妈在这次大会上还做了一个非常大胆的动作——她把AI加速器市场的长期预期给大幅上调了。去年在同一场Advancing AI大会上,AMD给出的预测是,到2028年,AI加速器市场的规模会增长到5000亿美元。这个数字在当时已经被很多人认为是相当乐观的了。但今年,苏妈直接把目标年份往后推到了2030年,并且把这个数字一口气提到了1.4万亿美元——一年之内,预期值翻了将近三倍。她接着解释说,到了那个体量,光是AI加速器这一个细分市场,到2030年就会跟今天整个半导体产业的总规模差不多大。这个预测的上调幅度可以说是相当激进的,在会场里引起了一阵不小的骚动。

那苏妈凭什么敢做出这么激进的预测呢?她给出了一个非常犀利而且很有说服力的判断。她说,今年是全球范围内“用于运行已经训练完成的模型的算力,首次超过用于训练新AI模型的算力”的历史性年份。她还给出了一个具体的比例数字:今年全部的AI算力消耗当中,大约有60%会被用在推理上。这个数据背后的含义非常深远——它意味着AI行业的重心正在发生一场悄无声息但影响巨大的转移。以前大家脑子里想的都是拼命烧钱、堆算力去训练更大更强的模型,训完之后就放在那里,最多做一些简单的演示或者开放给少量用户试用。但从最近五六个月开始,情况完全不同了。AI从一个只会被动回答问题的聊天机器人形态,快速进化成了能够自主规划行动路径、主动调用各种外部工具、独立完成复杂任务的智能体形态。这种进化带来的直接后果是,计算需求不是平缓地沿着一条斜线往上爬,而是像上楼梯一样,一阶一阶地往上跳。苏妈说到这里的时候,还抛出了一个让在场很多企业代表都深有感触的反问。她说:“我们这些在一线真正干活的人,难道不是每个月都清清楚楚地感觉到自己的AI预算在不断地往上涨吗?”她接着强调,归根结底,问题的核心根本就不在于芯片的理论峰值性能有多好看,而在于每生成一个token,到底要花多少钱。

这种需求结构层面的深刻变化,直接重塑了AMD设计硬件产品的底层逻辑。以前所有人的注意力都集中在怎么把一颗单独的芯片做到最强、最快、最省电,但现在这个思路已经行不通了。整个机架——包括CPU、GPU,还有负责机架内部和机架之间高速通信的网络芯片——必须作为一个不可分割的整体来进行设计。上台助阵的Meta基础设施负责人桑托什·贾纳丹,用自己的话来印证了苏妈的判断。他说得非常直截了当:把服务器硬件、网络架构、供电方案和散热设计拆开来各自独立优化的时代已经彻底结束了,我们现在所处的阶段,是必须跟合作伙伴肩并肩坐在一起,把整个数据中心当作一个统一的系统来从头设计。

而Helios,就是这个设计哲学转变之后诞生的第一个真正意义上的产物。它在发布当天就正式宣布进入了大规模量产阶段,不是什么遥不可及的路线图产品,而是已经可以在工厂里开足马力生产的真家伙。Helios把AMD最新的Instinct MI455X AI加速器、第六代服务器CPU Epyc Venice,以及负责管理机架内部高速通信的Pensando网络芯片,全部整合到了一个标准的机架里面。它的物理设计非常有特色,是把GPU计算模块、高带宽内存、供电转换单元和液冷散热通道全部做成了一体化的模块,最大限度地减少了信号传输距离和能量损耗。AMD同时还公布了一组硬碰硬的性能对比数据,显示跟主要竞争对手英伟达最新推出的机架级产品Vera Rubin相比,Helios在内存容量和内存带宽这两个关键指标上都占据了明确的领先位置。苏妈在台上说这句话的时候语气非常平淡,但内容却一点都不平淡:“简单来讲,Helios就是全世界最好的AI机架。”她紧接着又重申了一遍自己的核心论点:“客户最终得到的是实实在在的开支缩减,因为在同样的总投资额度下,你可以服务更多的终端用户,跑更多的推理请求。”

苏妈还特别指出了一个很容易被外界忽略的关键点,那就是智能体AI并不能仅仅依靠GPU的算力来正常运转。她说,一个智能体要去完成一项哪怕看起来很简单的任务,中间也必须经过几十个步骤的反复推理、多次的外部工具调用以及频繁的数据存取,而负责协调和组织这整个复杂流程的核心角色,其实是CPU。所以别看这几年GPU市场风光无限、好像CPU的存在感被大大削弱了,但实际上,服务器CPU的需求反而因为智能体AI的兴起而获得了一个全新的增长维度。这次发布的第六代Epyc服务器CPU Venice,就是一个非常能说明问题的典型案例。它采用了一个统一的底层芯片架构,但针对截然不同的工作负载类型做了非常精细的差异化设计。在同一个基础设计之上,AMD衍生出了三种定位各异的CPU版本:第一种是专门负责以最高效率给GPU持续投喂数据的,第二种是高密度的、能够在同一个功耗预算下同时运行数千个智能体实例的,第三种则是通用型的、专门处理企业内部各种常规计算任务的。每一种版本的微架构调优和缓存配置都不一样。

苏妈强调,这种精细化的细分策略带来了实实在在、可以用数据说话的性能差距。跟竞争对手的同级别x86架构处理器相比,专门为智能体沙箱运行环境设计的这款CPU,每瓦功耗所能同时处理的智能体数量多出了一倍以上;而跟基于ARM架构的竞争对手相比,在完整的机架级别上,每瓦性能的差距更是拉开到了三倍以上的水平。她说了一句非常实在的话:“到了数据中心那种动辄成千上万个机架的规模,这种每瓦性能上的差距,最终会转化成一个极其现实的问题——在同样的电力供应预算和碳排限额之下,你到底能同时运行多少个智能体来为你的业务创造价值。”

这次大会还有一个特别值得细细品味的环节,就是有好几家重量级的行业玩家轮流上台,当着全场观众的面,详细分享了他们跟AMD的合作深度以及实际使用中的一手体验。Anthropic、OpenAI、Meta、Cerebras的代表一个接一个地走上讲台,各自讲述了他们是如何将AMD的AI系统融入自身技术栈的,以及双方的合作关系已经深入到了什么程度。OpenAI的计算战略副总裁萨钦·卡蒂透露了一个非常重要的信息:之前对外公开宣布的那个规模高达6吉瓦的算力基础设施合同,目前的执行进度非常顺利,没有遇到什么大的障碍。他还说,OpenAI从AMD上一代的GPU产品开始就一直保持着紧密的合作关系,而这一次,他们是整个行业内第一家实际收到Helios机架系统的公司,并且已经把这些机架投入到了大规模前沿模型的训练工作中。Meta的桑托什·贾纳丹则介绍说,他们在连续好几代产品中都大规模部署了AMD的服务器CPU,累计用量已经达到了数百万颗的量级。他还特别提到,现在双方的合作关系已经紧密到了一种新的境界——Meta不再仅仅是购买AMD已经做好的成品,而是从最早期的最初设计阶段开始,Meta的工程师就跟AMD的研发团队坐在同一张桌子旁边,一起讨论供电架构应该怎么搭、散热方案用什么形式、服务器主板怎么布局、通信设备怎么选型。Cerebras的首席执行官安德鲁·费尔德曼上台介绍了他们公司的独特业务模式——制造超大尺寸的AI芯片,这些芯片既可以部署在客户的私有数据中心里,也可以通过云端按需提供算力。他说他们已经成功拿下了包括OpenAI和亚马逊AWS在内的一大批重量级客户。他还特别提到了一项联合优化的成果:以前整个行业在做AI推理的时候,不得不在“快速处理大批量数据”和“给单个请求提供超低延迟响应”这两个目标之间做痛苦的取舍,但这次通过跟AMD的深度技术合作,他们在完全没有牺牲响应时间的前提下,把整个系统的吞吐量提升了整整五倍。

整场发布会从头看到尾,能非常清晰地感受到一个信号:AMD在AI基础设施这条赛道上的整体打法,已经发生了根本性的、战略层面的转变。他们不再满足于跟在竞争对手身后,在单颗芯片的峰值算力指标上做逐瓦的追赶,而是从整个系统的宏观视角出发去重新思考和定义问题,试图通过系统层面各个组件之间的深度协同优化,来实实在在地降低总体拥有成本、提升实际运营效率。Helios的正式发布和即刻量产,标志着AMD正式以一套完整的产品形态,杀入了机架级AI系统这个原本由少数几家厂商主导的高端战场,而且一上来就拿出了已经可以交付的实体产品和具体的第三方性能对比数据。接下来的最大悬念就是,这套系统在全球各地的大型数据中心里大规模铺开部署之后,实际运行中的表现到底能不能像苏妈在旧金山那个舞台上所说的那样,帮客户切切实实地把钱省下来、把效率提上去。答案不会让大家等太久的——市场的真实反馈,永远是检验一切技术宣言的唯一标准。

新闻来源:韩国《朝鲜日报》旗下财经媒体 Chosunbiz



本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

x
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

APP|手机版|小黑屋|关于我们|联系我们|法律条款|数码之家-技术知识分享平台

闽公网安备35020502000485号

闽ICP备2021002735号-2

GMT+8, 2026-7-24 09:27 , Processed in 0.078000 second(s), 7 queries , Gzip On, Redis On.

Powered by Discuz!

© MyDigit.Net Since 2006

快速回复 返回顶部 返回列表