|
|
本帖最后由 麻薯滑芝士 于 2026-7-31 11:53 编辑
嘿,各位每天泡在存储极客论坛和SSD评测网站,对每一代闪存层数和接口带宽如数家珍、看到“DWPD”和“IOPS”就跟看到老朋友一样亲切的硬件发烧友,各位在阿里云、腾讯云或者字节跳动的数据中心里天天跟服务器集群打交道、最头疼的就是GPU因为等数据而空转、恨不得把硬盘直接焊在显卡旁边、让数据跑得比闪电还快的运维工程师,各位正在训练千亿甚至万亿参数大模型、每天被海量训练数据的加载速度折磨得抓耳挠腮、做梦都想让存储系统跑得比GPU还快的算法研究员和机器学习工程师,各位虽然不搞企业级采购但对PCIe 6.0这几个字充满好奇、想知道这玩意儿什么时候能下放到自家游戏电脑里、好让自己最爱玩的那几款游戏加载时间再缩短几秒的DIY装机爱好者,还有各位纯粹是被“332层”和“61.44TB”这两个数字震住、想搞清楚这到底是啥黑科技、跟咱们平时用的固态硬盘有啥区别、会不会让以后电脑变得更便宜的普通网民,你们今天刷到的这条消息,绝对值得把手里的奶茶放下、把后台正在下载的游戏暂停、把浏览器标签页切换到阅读模式、认认真真把全文看完。
因为就在今天,也就是2026年7月31号,全球知名的闪存和固态硬盘制造商铠侠,正式对外宣布他们已经开始了新一代CM10系列企业级固态硬盘的出货工作,而这一批SSD最大的看点就是:它们是全世界第一批搭载PCIe 6.0接口的产品,同时也是第一批用上铠侠最新一代BiCS Flash 10代332层TLC闪存颗粒的量产型固态硬盘。这可不是什么实验室里的原型机或者PPT上的概念产品,而是实打实已经开始发给特定数据中心客户的成品,意味着PCIe 6.0这个下一代高速接口标准,终于从纸面规格变成了可以插在服务器主板上跑实际业务的东西了。
咱们先把时间轴拉回到PCIe 5.0刚刚普及的那段时间,好好捋一捋这背后的来龙去脉。大概是从2023年到2025年这几年间,PCIe 5.0接口的固态硬盘逐渐从高端消费市场渗透到了企业级领域,顺序读取速度普遍突破了每秒10GB的大关,随机读写性能也有了明显提升。那时候大家都觉得,每秒10GB的速度已经快到离谱了,一张蓝光原盘电影两三秒钟就能读完,还有什么应用能喂饱这么宽的管道?结果没想到,人工智能大模型的爆发来得如此迅猛。随着GPT、Claude、Llama这些大语言模型的参数规模从几十亿暴涨到几千亿甚至上万亿,那些在云端或者企业内部部署的AI训练集群,对存储系统的要求也跟着水涨船高——模型训练过程中需要频繁读取海量的训练数据,每一次参数更新都要把成千上万个小文件从硬盘里捞出来喂给GPU去算,这时候如果存储设备的读写速度跟不上,GPU就只能闲着等数据,造成算力的严重浪费。这种浪费可不是小数目,一块H100或者B200 GPU一个小时的电费加上折旧成本就要好几十块钱,如果一千块GPU同时因为等数据而空转,那损失简直不敢想。正是这种来自AI领域的迫切需求,倒逼着存储厂商不得不加快下一代接口的研发进度,于是PCIe 6.0就这么被推到了前台。而铠侠这次的CM10系列,就是在这个背景下诞生的第一波成果,可以说恰逢其时。
咱们来看看铠侠官方公布的性能数据,虽然他们没有直接给出具体的读写速度数值,但给出了一个非常直观的对比:相比上一代PCIe 5.0的固态硬盘,CM10系列在顺序读取性能上提升了大约92%,在随机读取性能上提升了大约85%。这两个数字意味着什么呢?咱们拿目前市面上最快的PCIe 5.0企业级SSD来做个参照——那些顶级型号的顺序读取速度大概在每秒14GB左右,如果按92%的增幅来算,CM10的顺序读取速度应该能冲到每秒26GB到27GB这个区间。至于随机读取,PCIe 5.0企业级SSD的4K随机读取通常能做到每秒150万到200万次IOPS,提升85%就意味着每秒300万到370万次IOPS的水平。这个性能提升幅度,对于需要在短时间内加载大量小文件的AI推理和训练场景来说,简直是雪中送炭。举个例子,当你在训练一个拥有万亿参数的大语言模型时,每次epoch都需要从存储系统中读取数以亿计的token数据,如果SSD的随机读取速度能翻将近一番,那整个训练周期就能缩短将近一半的时间,省下来的电费和服务器租赁费用可不是一个小数目。而且别忘了,这还只是官方给出的保守估计,实际跑起来可能还会更高。
接下来咱们深入聊聊CM10系列的核心技术——BiCS Flash 10闪存颗粒。这是铠侠的第10代3D NAND闪存技术,堆叠层数达到了332层,比上一代BiCS Flash 9的约256层又往上拔高了一大截。闪存层数的增加意味着什么?简单来说,就是在同样大小的芯片面积上,可以塞进去更多的存储单元,从而实现更高的单颗颗粒容量和更低的每GB成本。332层的堆叠高度,对于制造工艺的要求是非常苛刻的,因为层数越多,钻孔蚀刻的难度就越大,各层之间的电气特性一致性也越难保证。你可以想象一下,要在只有几微米厚的硅片上,垂直钻出332层通孔,每一层的孔径和深度都要精确控制在纳米级别,稍有偏差整片晶圆就报废了。铠侠能够在2026年年中实现332层TLC闪存的量产,说明他们在3D NAND工艺上确实走在了行业前列。而且他们选用的是TLC类型,也就是每个存储单元存储3比特数据,在成本和性能之间取得了比较好的平衡——比起QLC来说寿命更长、写入速度更快,比起MLC来说成本更低、容量更大,非常适合企业级那种需要大容量和高耐久度的应用场景。另外值得一提的是,BiCS Flash 10在接口速度上也做了升级,能够更好地匹配PCIe 6.0的超高带宽,不至于让闪存颗粒成为数据传输的瓶颈。
说到应用场景,铠侠这次把CM10系列的目标定位得非常明确:就是冲着AI基础设施去的。官方新闻稿里特意提到了两个关键词:NVIDIA CMX架构支持和AI推理与上下文缓存优化。这个NVIDIA CMX架构是什么呢?它是NVIDIA在Grace Hopper和Blackwell等新一代AI超级芯片上引入的一种统一内存架构,可以让CPU和GPU共享同一块物理内存池,从而消除传统架构中数据在CPU内存和GPU显存之间来回拷贝的瓶颈。而要充分发挥CMX架构的优势,就需要存储系统能够以极高的速度将数据喂给这个统一内存池,否则CPU和GPU再快也得等着硬盘慢慢读数据。铠侠的CM10 SSD正是瞄准了这个缺口,用PCIe 6.0的超高带宽来填满CMX架构的数据胃口。另外,上下文缓存这个功能对于大语言模型的推理服务尤其重要——当你在跟一个AI聊天机器人对话时,它需要记住前面说过的话才能给出连贯的回答,这些历史对话数据就被缓存在存储设备里,如果缓存的读写速度不够快,对话就会出现明显的卡顿和延迟。CM10的高速随机读取能力,正好能解决这个问题。想象一下,如果你在用ChatGPT或者文心一言聊天,每次发送消息后要等好几秒才能得到回复,那体验得多糟糕。而有了CM10这样的高速SSD做后端缓存,AI助手的响应速度就能做到几乎无感。
咱们再聊聊这款SSD的物理规格和散热设计。作为一款面向数据中心的产品,CM10系列提供了多种外形尺寸供客户选择,包括E3.S、E1.S以及传统的2.5英寸规格,其中E3.S和E1.S还有9.5毫米厚度的版本。不同的尺寸适用于不同类型的服务器机箱和背板设计,给数据中心采购人员提供了很大的灵活性。比如E3.S这种规格,它的宽度和长度都比传统的2.5英寸盘要小,但厚度可以做得更薄,适合那种高密度的存储服务器,一个2U机箱里能塞进几十块。而E1.S则是更细长的形状,有点像口香糖,适合那种前置热插拔的硬盘仓。在散热方面,铠侠考虑得很周全——CM10既支持直接冷板冷却标准,也就是那种把液冷板直接贴在SSD表面带走热量的高效散热方案,同时也保留了常规散热片的安装孔位,对于那些暂时没有部署液冷系统的机房来说,用传统的铝制或者铜制散热片也能应付得来。毕竟PCIe 6.0的控制器和闪存颗粒在高负载下的发热量不容小觑,如果没有良好的散热措施,很容易触发降频保护导致性能下降。铠侠在这点上做了两手准备,既拥抱了未来的液冷趋势,也没抛弃现有的风冷用户,考虑得相当周到。
容量和耐久度方面,CM10系列的覆盖面非常广。起始容量是1.6TB,往上一直到61.44TB,中间应该还有3.2TB、6.4TB、12.8TB、25.6TB等多个档位。这个61.44TB的最大容量是什么概念呢?目前市面上最大的企业级SSD大多停留在30TB到60TB这个区间,61.44TB已经摸到了这个级别的天花板,一块硬盘就能装下几十个大型语言模型的全部参数和训练数据。比如说Meta最近开源的Llama 4模型,如果它的参数规模是两万亿,那么整个模型的权重文件大概需要几百GB的存储空间,一块61.44TB的SSD可以轻轻松松存下上百个不同版本的模型,而且还能留出大量空间给训练数据和日志。耐久度方面,铠侠提供了两种模式:一种是读取密集型模式,对应的每日全盘写入次数为1次,也就是1 DWPD,适合那些以读取为主的AI推理和内容分发场景;另一种是混合使用模式,对应的每日全盘写入次数为3次,也就是3 DWPD,适合那些需要频繁写入的训练数据预处理和日志记录场景。客户可以根据自己的实际负载特点来选择合适的型号,避免为用不到的写入寿命多花钱。这个设计思路很务实,因为不同业务的写入压力差别很大,AI推理主要就是读,一天写不了多少数据;而训练数据预处理则需要不停地写中间结果,写入量很大。如果统一用一种耐久度,要么浪费钱,要么不够用。
安全特性也是企业级SSD不可忽视的一环,毕竟数据中心里存储的都是敏感数据,可能是用户的个人信息、企业的商业机密,甚至是国家的关键数据。CM10系列在这方面做得相当齐全:支持SIE软件即时擦除、SED自加密硬盘、以及计划中的SED FIPS 140-3认证版本,这个FIPS 140-3是美国联邦信息处理标准的最新版本,通过了这个认证就意味着可以合法地用于美国政府机构和军工项目。此外,铠侠还加入了CNSA 2.0推荐的后量子密码学算法支持,这是一种能够抵御未来量子计算机攻击的加密技术,虽然量子计算机目前还没有成熟到可以破解现有加密的程度,但提前布局总没错。毕竟SSD的使用寿命往往长达五年甚至十年,谁能保证十年后量子计算机不会成为现实呢?另外还有SPDM 1.4安全协议认证,这个协议主要用于服务器组件之间的身份验证和通信加密,防止恶意固件篡改或者假冒设备接入系统。简单来说,就是确保插在服务器上的这块SSD确实是铠侠生产的正品,没有被中间人替换成带有后门的假货。
在协议和规范兼容性方面,CM10系列支持Open Compute Project数据中心NVMe SSD规范2.7版本,这个OCP规范是由Facebook等互联网巨头牵头制定的开放标准,旨在让不同厂商的SSD在统一的框架下互操作,降低数据中心的供应链风险。同时还支持NVMe Flexible Data Placement功能,也就是灵活数据放置,这个技术允许主机系统更精细地控制数据在闪存颗粒中的物理存放位置,从而减少写入放大效应、延长SSD寿命。写入放大是SSD的一个老大难问题,因为闪存不能像机械硬盘那样直接覆盖写,必须先擦除再写入,导致实际写入的数据量往往比主机请求的数据量大好几倍。有了FDP,操作系统可以把热数据和冷数据分开存放,减少不必要的搬移,从而降低写入放大系数,延长SSD的使用寿命。
关于价格和具体的性能基准测试数据,铠侠目前还没有向公众公开。官方表示,价格需要通过向指定的数据中心客户直接询价才能获取,也就是说普通消费者和中小型企业暂时是买不到的,这玩意儿从一开始就不是摆在电商货架上卖给个人的东西。至于实际的读写速度到底能跑到多少,铠侠计划在2026年8月4号到6号期间,在美国加利福尼亚州圣克拉拉市举办的Future of Memory and Storage大会上正式公布。这个大会是存储行业的年度盛会,各大闪存厂商都会在会上展示最新的技术和产品,到时候我们应该能看到CM10系列在基准测试软件下的真实表现,包括顺序读写、随机读写、延迟分布、功耗曲线等详细数据。届时肯定会有不少媒体到场报道,咱们可以第一时间拿到一手信息。
咱们再把视野拉远一点,看看PCIe 6.0这个接口标准对整个行业的意义。PCIe 6.0相比PCIe 5.0,最大的变化是数据传输速率从每通道32GT/s翻倍到了64GT/s,同时引入了PAM4脉冲幅度调制编码和低延迟前向纠错等技术。在x16的配置下,PCIe 6.0的双向总带宽可以达到约256GB/s,是PCIe 5.0的两倍。这个带宽对于AI训练集群来说至关重要,因为当你在使用数百块GPU并行训练一个大模型时,每一块GPU都需要从存储系统中读取数据,如果存储接口的带宽不够,就会形成瓶颈,导致GPU利用率下降。铠侠的CM10 SSD作为首批PCIe 6.0产品,虽然目前只面向数据中心客户,但它标志着PCIe 6.0生态已经从标准制定阶段进入了实际部署阶段。可以预见的是,在接下来的半年到一年内,其他存储厂商比如三星、SK海力士、美光等也会陆续推出自己的PCIe 6.0企业级SSD,届时市场竞争会变得更加激烈,价格也有望逐步下降。这对于整个AI产业来说是个好消息,因为更快的存储意味着更短的训练时间,更低的成本,最终会让AI应用更加普及。
不过需要注意的是,PCIe 6.0目前还远没有到进入普通消费者PC的时候。一方面是因为消费级应用对带宽的需求没有那么迫切,即便是最顶级的游戏或者视频剪辑软件,PCIe 5.0的带宽也绰绰有余;另一方面是PCIe 6.0的控制器和信号完整性设计要求更高,成本也更高,短期内很难做到消费级产品的价位。所以各位DIY玩家暂时不用急着升级主板和SSD,安心用你们的PCIe 5.0甚至PCIe 4.0就好,等PCIe 6.0的消费级产品出来至少还得两年以上。而且到时候还得看Intel和AMD的新平台是否原生支持PCIe 6.0,配套的CPU和主板也得跟着换代,整套平台的升级成本可不低。
最后咱们把今天这条消息的核心要点再过一遍:铠侠在今天正式宣布开始向指定数据中心客户出货CM10系列企业级固态硬盘,这是全球首批采用PCIe 6.0接口的SSD产品。CM10系列搭载了铠侠最新的BiCS Flash 10代332层TLC闪存颗粒,顺序读取性能相比PCIe 5.0提升了大约92%,随机读取性能提升了大约85%。这款SSD支持NVIDIA CMX架构,针对AI推理和上下文缓存进行了优化,提供从1.6TB到61.44TB的容量选项,以及1 DWPD和3 DWPD两种耐久度模式。外形规格涵盖E3.S、E1.S和2.5英寸等多种尺寸,支持直接冷板冷却和传统散热片两种散热方案。安全特性包括SED自加密、FIPS 140-3认证、后量子密码学和SPDM 1.4协议。具体价格需向铠侠直接询价,详细的性能基准测试数据将在8月4日至6日于加州圣克拉拉举行的Future of Memory and Storage大会上公布。
对于正在为AI训练集群选型的企业IT决策者,我的建议是这样的:如果你当前的存储系统已经成为训练管道的瓶颈,GPU利用率长期低于80%,那么可以考虑联系铠侠索取CM10系列的样品进行评估,重点测试在你实际的工作负载下——比如大规模随机读取小文件、高并发上下文缓存访问——PCIe 6.0能否带来立竿见影的效果。如果你目前的PCIe 5.0 SSD已经能满足需求,那倒不必急于升级,毕竟新一代产品的价格通常会比较高,而且配套的PCIe 6.0服务器平台也才刚刚开始铺货。但对于那些正在规划下一代超大规模AI集群的团队来说,铠侠的CM10系列无疑提供了一个非常有吸引力的选项——它用332层的堆叠技术和翻倍的接口带宽,把存储系统的天花板又往上抬了一大截,让万亿参数级别的模型训练不再被硬盘读写速度所拖累。等到8月初的存储大会上一旦公布了具体的跑分数据,这场PCIe 6.0存储革命的序幕就算是正式拉开了。而对于咱们普通消费者来说,虽然暂时用不上这么高端的产品,但看着技术一步步向前推进,心里还是挺踏实的——毕竟今天的旗舰技术,明天就会变成白菜价走进千家万户。
|
本帖子中包含更多资源
您需要 登录 才可以下载或查看,没有账号?立即注册
x
|