数码之家

 找回密码
 立即注册

QQ登录

只需一步,快速开始

搜索
查看: 30|回复: 0

[业界] 华为给DeepSeek备了16万张昇腾950DT加速卡,内蒙古那座数据中心要起飞了

[复制链接]
发表于 半小时前 | 显示全部楼层 |阅读模式
本帖最后由 麻薯滑芝士 于 2026-9-8 19:27 编辑

嗨,各位每天泡在各大AI技术社群里、盯着每一款新芯片的跑分数据反复对比、恨不得把算力排行榜刻进脑子里的硬件发烧友,你们是不是早就听腻了“国产芯片即将逆袭”这种翻来覆去说了八百遍的老话?各位在DeepSeek、百度、阿里、字节跳动这些国内AI大厂里负责服务器采购和集群部署的架构师与技术总监,你们是不是每年做预算的时候都要在“继续买英伟达的阉割版”和“赌一把国产方案”之间来回摇摆、两边都不踏实?各位在内蒙古、贵州、甘肃这些西部地区搞大数据产业园的政府官员和招商负责人,你们是不是一直在等一个真正拿得出手的标杆项目,来证明“东数西算”这个国家战略不是停留在文件里的空话?各位在高校计算机系里钻研分布式系统、互联网络、异构计算这些方向的教授和在读博士生,你们是不是对华为那个据说能把几十万块芯片连在一起的互联协议充满了好奇,想知道它到底能不能跟英伟达的NVLink正面较量一番?各位在私募基金和券商研究所里天天盯着半导体赛道、反复推演国产替代逻辑的分析师和基金经理,你们是不是急需一个实实在在的大额订单来验证自己手里的投资逻辑到底站不站得住脚?各位平时靠DeepSeek的API接口做翻译、写代码、跑数据分析的自由职业者和中小企业主,你们是不是经常在晚上八九点钟的高峰时段被接口卡得火冒三丈,恨不得DeepSeek赶紧把算力堆上去别再让用户体验这么拉胯?各位长期关注中美科技博弈、对国产芯片又爱又恨、心情像坐过山车一样的旁观者,你们是不是特别想知道这16万块芯片的订单到底意味着华为追到了哪一步、距离英伟达还有多远?各位纯粹就是喜欢看大厂烧钱搞基建、觉得这种动辄几十亿砸下去的新闻比好莱坞大片还过瘾的吃瓜群众,你们是不是也想算算这个数据中心一旦建成,一个月光电费就得烧掉多少钱?

不管你属于上面列出的哪一类人,不管你是靠这行吃饭还是纯粹看热闹,今天这篇文章要聊的事情,绝对值得你耐着性子看完。因为就在昨天,也就是2026年9月7日,一家名叫Techpowerup的海外硬件科技媒体爆出了一条让整个中文科技圈瞬间炸锅的消息——国内人工智能领域的头部玩家DeepSeek,向华为下了一张史无前例的大订单,一口气采购了16万块昇腾950DT加速器。而且这还不是那种分批交付、分散部署到好几个机房里的常规操作,DeepSeek的计划是把这16万块芯片全部塞进同一个数据中心里,选址就定在内蒙古。这个消息意味着什么?往小了说,这是国产AI芯片第一次拿到超大规模商业部署的真正入场券;往大了说,这意味着华为在被全方位技术封锁这么多年之后,终于用自研方案接住了一个顶级客户的信任票,国产替代这件事从口号变成了实打实的行动。

事情的来龙去脉得从去年年底开始捋。2025年年底,华为在一场内部技术沟通会上对外透露,公司正在紧锣密鼓地准备一系列新一代AI芯片以及整机柜级别的全套解决方案,目标很明确,就是要满足国内AI市场对算力那种近乎饥渴的需求。当时华为并没有公布具体的产品参数和量产时间表,只是给了一个大致的方向和路线图。说实话,那个时候很多人心里是打鼓的。毕竟华为这几年在芯片制造环节被卡脖子卡得非常狠,先进制程的代工渠道几乎被全部切断,外界普遍认为华为短期内很难拿出一款能跟英伟达正面竞争的成熟产品。但是华为硬是顶着巨大的压力把这条路给走通了。从2026年年初开始,昇腾950系列芯片的量产节奏明显加快了,先是小批量交付给一些科研机构和运营商做测试验证,随后产能开始逐步往上爬。到了2026年年中的时候,良率和产量都已经稳定在了一个相当可观的水平上。DeepSeek这16万块的订单,就是在这样一个背景下正式敲定的。它不是一次试探性的小批量采购,而是一步到位的规模化部署,这说明DeepSeek对昇腾950DT的性能和稳定性已经有了足够的信心。

那么,昇腾950DT这块芯片到底有什么过人之处,能让DeepSeek下定决心掏出这么大一笔预算?我们来一项一项拆开看。首先是内存部分。每一块昇腾950DT加速器搭载了144GB的HBM高带宽内存,而且这个HBM不是华为从外面买来的现成产品,而是基于华为自己研发的HBM设计方案制造出来的。这一点非常关键,值得多说几句。HBM内存是全球存储芯片领域技术壁垒最高的产品之一,长期以来被韩国SK海力士、韩国三星以及美国美光这三家巨头牢牢把持着。华为在被全方位技术封锁的情况下,硬是靠着自己的研发能力搞出了自研的HBM方案,这本身就是一件了不起的事情。这块自研HBM内存能够提供接近每秒4TB的带宽,换算一下就是4000GB每秒。为了让你对这个数字有更直观的感受,我们拿英伟达上一代的旗舰产品H100来做个对比。H100搭载的是80GB的HBM3内存,带宽大约是每秒3.35TB。昇腾950DT在内存容量上是H100的1.8倍,带宽也比H100高出大约20%。当然,内存和带宽只是基础条件,对于一块AI加速器来说,算力才是衡量它真实水平的硬通货。

在算力方面,昇腾950DT的表现同样不含糊。根据Techpowerup那篇报道中引用的数据,这块芯片在FP8精度下的峰值算力可以达到大约1 PetaFLOPS。PetaFLOPS这个单位你可能不太熟悉,简单解释一下,1 PetaFLOPS就是每秒可以完成一千万亿次浮点运算。如果把精度降到FP4,这个数字可以翻一倍,达到大约2 PetaFLOPS。FP8和FP4这两种低精度运算格式对于AI推理任务来说是至关重要的,因为绝大多数神经网络模型在部署上线、实际提供服务的时候,并不需要FP32或者FP16那么高的精度。降低精度不仅可以大幅提升计算吞吐量,还能减少内存占用和功耗,一举两得。DeepSeek之所以选择昇腾950DT来搭建推理集群,很大程度上就是看中了它在低精度推理场景下的出色表现。当然,跟英伟达最新的Blackwell架构相比,昇腾950DT在绝对算力上还有一些差距,但考虑到华为在制造工艺严重受限的情况下能交出这样一份答卷,已经足够让人刮目相看了。

接下来我们聊聊整个系统的规模。DeepSeek的计划是把这16万块昇腾950DT全部集中部署在位于内蒙古的一个数据中心里面。为什么要选内蒙古?原因其实并不难猜。内蒙古的电力资源非常丰富,尤其是风电和光伏发电的成本在全国范围内都属于最低的那一档。而且内蒙古地处北方,年平均气温很低,一年里有大半年可以利用自然界的冷空气来给数据中心降温,散热成本能省下一大笔开支。再加上内蒙古地广人稀,土地价格跟北京上海比起来简直是白菜价。把这些因素综合在一起算一笔账就会发现,在内蒙古建设大规模AI数据中心的总拥有成本,要比在东部一线城市低至少一半以上。DeepSeek选择在这里落地,显然是做过精细的成本核算之后做出的理性决策。

那么这个数据中心一旦建成,整体的算力规模能达到什么水平呢?我们来动手算一算。每块昇腾950DT在FP8精度下的峰值算力是1 PetaFLOPS,16万块加在一起就是16万PetaFLOPS。16万PetaFLOPS换算成ExaFLOPS就是160 ExaFLOPS。如果切换到FP4精度,这个数字可以翻倍到大约320 ExaFLOPS。320 ExaFLOPS是什么概念?目前全球排名第一的超算,也就是美国橡树岭国家实验室的Frontier,它的峰值算力大约是1.68 ExaFLOPS。也就是说,DeepSeek这一个数据中心的理论峰值算力,相当于将近200台Frontier超算捆在一起干活。当然,在实际应用中不可能跑到理论峰值,但这个数字依然足以让人目瞪口呆。除了算力之外,这个数据中心还将拥有大约23PB的总HBM内存。23PB就是23000TB,相当于23000块容量为1TB的消费级固态硬盘加在一起。这么大的内存池意味着什么?意味着DeepSeek可以把海量的模型参数和推理数据直接加载到内存里面,不需要频繁地从硬盘读取数据。这样一来,推理延迟会大幅降低,同一时间能够处理的请求数量也会显著提升。根据Techpowerup那篇报道的描述,这套系统可以同时服务数千家企业客户而不会出现性能瓶颈。对于DeepSeek现有的API用户来说,这无疑是一个重大利好——以后高峰期卡顿、超时、报错的情况大概率会大大减少。

那么问题来了,16万块加速卡要如何在同一个数据中心里高效协同工作?这个问题其实比很多人想象的要复杂得多。你不能简单地把16万块显卡插在服务器上然后连上网线就完事了。芯片和芯片之间的数据传输速度以及整个互联网络的拓扑结构,直接决定了这个集群的实际运行效率。如果互联带宽跟不上,就算每块芯片的算力再强,也会因为通信瓶颈导致整体性能大打折扣。华为显然也提前想到了这个问题,所以他们专门为昇腾950DT设计了一套全新的互联方案,叫做凌驱互联协议。这个协议配合光纤链路一起使用,可以实现超大规模集群内的高速数据交换。根据华为之前公布的一些技术资料,凌驱互联协议的设计目标,是能够把几十万块昇腾加速卡无缝连接在一起,形成一个统一的算力池,让所有芯片像一个整体一样协同工作。

在具体的硬件部署层面,华为提供了一种叫做Atlas 950 SuperPoD的整机柜方案。每个Atlas 950 SuperPoD最多可以容纳8192块昇腾950DT芯片。也就是说,一个SuperPoD就是一个独立的算力单元,内部已经把互联和散热这些基础设施全部做好了。然后这些SuperPoD可以继续往上堆叠,理论上最多可以扩展到64个Atlas SuperPoD,加起来总共可以容纳524288块加速卡。DeepSeek这次订购了16万块,算一下就知道,大约需要20个Atlas 950 SuperPoD来承载。这个数量距离华为给出的理论上限还有非常大的扩展空间。这也意味着DeepSeek未来如果觉得算力不够用了,想要继续扩容,完全不需要重新设计基础设施架构,直接在现有的SuperPoD基础上往上叠加就行了。对于一家处于快速成长期的AI公司来说,这种灵活的扩展能力至关重要。

说到这里,可能有人会问:DeepSeek搞这么大的推理中心,到底是要用来干什么的?答案其实很明确——大规模推理服务。所谓推理,就是把已经训练好的AI模型部署到生产环境当中,让它接受用户的请求并返回计算结果。无论你是用DeepSeek的API写代码、做翻译、生成文案,还是企业客户调用DeepSeek的模型来处理客服对话、分析财务报表、审核合同条款,所有这些操作的背后都需要推理算力来支撑。随着DeepSeek的用户数量和API调用量不断增长,原有的推理基础设施迟早会面临巨大的压力。特别是在一些流量高峰期,比如工作日的白天、电商促销活动期间,API响应速度变慢甚至直接超时的情况时有发生。而这个位于内蒙古的超大规模推理中心一旦投入使用,DeepSeek的推理能力将会得到质的飞跃。16万块昇腾950DT同时在线运转,数千家企业客户的请求可以被并行处理,几乎不会出现排队等待的情况。

当然,我们也必须清醒地认识到,国产AI芯片的崛起之路才刚刚起步,前方还有很多挑战等着去克服。昇腾950DT虽然在内存容量和带宽上交出了一份漂亮的成绩单,但在生态兼容性和软件工具链方面,跟英伟达的CUDA生态相比还有不小的差距。很多AI开发者和企业用户之所以迟迟不愿意迁移到国产芯片,不是因为国产芯片的硬件性能不够好,而是因为迁移的成本太高了——已有的代码、框架、优化工具全都是基于CUDA开发的,要全部移植到华为的CANN平台上,需要投入大量的人力、时间和金钱。好在华为这几年一直在大力推动CANN生态的建设,也在积极跟国内主流的AI框架比如PyTorch、TensorFlow、百度飞桨等进行适配和优化。随着越来越多的企业和开发者开始使用昇腾芯片,生态方面的短板应该会逐渐被补齐。

从更宏观的视角来看,DeepSeek这次的大手笔采购,释放出了一个非常强烈的信号:中国的AI产业正在加速摆脱对进口芯片的依赖。过去两年多的时间里,美国政府不断收紧对华芯片出口管制措施,英伟达的A100、H100、H200乃至专门为中国市场量身定做的各种降级版芯片,都面临着越来越严格的审批门槛和出口限制。在这样的背景下,国内的AI实验室和企业不得不寻找替代方案。华为昇腾系列无疑是目前市面上最成熟的国产替代选项之一。DeepSeek作为国内AI领域的头部玩家,率先站出来吃这只螃蟹,不仅是对华为芯片的一次大规模实战检验,也是对整个国产AI芯片产业链的一次强力拉动。16万块的订单量,足以让华为的昇腾生产线满负荷运转好几个月,同时也给上游的封装、测试、PCB电路板、散热模组、电源管理等等配套厂商带来了巨大的商业机会。

最后,我想说说我个人对这件事的看法。我觉得这是一个标志性的事件,它意味着国产AI芯片已经从“实验室样品”的阶段正式迈入了“规模化商用”的阶段。当然,前方的路还很长,挑战依然不少。昇腾950DT能否在实际的大规模推理场景中展现出跟纸面参数一样出色的性能?凌驱互联协议在高负载下的稳定性和延迟表现到底怎么样?CANN平台的易用性和兼容性能不能真正让开发者满意?这些问题都需要时间来给出答案。但不管怎么说,DeepSeek和华为联手迈出的这一步,已经让很多人看到了国产AI算力崛起的希望。接下来的几个月里,我会持续关注这个内蒙古数据中心的建设进展,也会在它正式投入运营之后想办法做一些实际的性能测试,到时候再跟大家分享一手体验。如果你也对国产芯片和AI算力的话题感兴趣,记得点个关注,咱们后面有的是时间慢慢聊。







本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

x
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

APP|手机版|小黑屋|关于我们|联系我们|法律条款|数码之家-技术知识分享平台

闽公网安备35020502000485号

闽ICP备2021002735号-2

GMT+8, 2026-9-8 19:54 , Processed in 0.218400 second(s), 9 queries , Gzip On, Redis On.

Powered by Discuz!

© MyDigit.Net Since 2006

快速回复 返回顶部 返回列表