数码之家

 找回密码
 立即注册

QQ登录

只需一步,快速开始

搜索
查看: 72|回复: 2

[业界] 铠侠CXL内存模组即将送样,联手NVIDIA打造AI算力新引擎:DRAM瓶颈终结者来了

[复制链接]
发表于 4 小时前 | 显示全部楼层 |阅读模式
各位每天在服务器机房盯着功耗墙挠头的AI算法工程师,各位为训练集群内存带宽不够用而疯狂砸钱采购DRAM的数据中心运维主管,各位蹲在二手市场淘企业级SSD却始终嫌贵的硬件发烧友,各位在投资群里天天盯着存储芯片板块K线图的散户股民,各位正在为大模型长上下文推理成本发愁的创业团队CTO,各位刚接触CXL协议还不清楚它到底能干啥的系统架构师,各位对NVIDIA最新CMX架构充满好奇但又担心被割韭菜的吃瓜群众,以及各位纯粹就是想看看日本半导体公司铠侠到底还有多少压箱底技术的科技爱好者——不管你属于上面哪一个阵营,只要你跟“存算一体”这四个字沾点边,今天这篇文章你都值得花几分钟看完。因为就在刚刚过去的这个礼拜,铠侠那边放出了一个信号,可能会直接影响到明年你买服务器的预算分配方案,甚至可能让你对内存和闪存之间那条原本泾渭分明的界限产生全新的认识。

事情是这样的。根据TrendForce在2026年9月7日发布的报道,以及EE Times Japan对铠侠在9月3日一场技术简报会的详细记录,这家总部位于东京的NAND闪存巨头,正在用一种非常有意思的思路来解决当前AI计算领域最大的痛点之一:内存容量不够用。咱们都知道,现在大模型训练和推理对内存的需求已经到了近乎贪婪的地步,动不动就是几百GB甚至TB级别的显存占用。但是DRAM这个东西吧,物理上有个天花板,单颗Die的容量做到一定程度就很难再往上堆了,而且越往高容量走,成本和功耗就越吓人。那怎么办呢?铠侠给出的答案是:别光盯着DRAM一棵树上吊死,咱们把一部分内存活儿交给闪存干,但不是那种传统的当硬盘用的闪存,而是经过特殊改造、能直接挂在内存总线上的CXL内存模组。

这里得稍微解释一下CXL是个啥东西,不然有些朋友可能听着有点懵。CXL的全称是Compute Express Link,说白了就是一种高速互联协议,它的作用就是让CPU、GPU、内存、加速器这些东西能够以一种更高效、更低延迟的方式互相访问数据。以前你要给服务器加内存,只能插DIMM槽,用DDR协议,容量受限于主板物理槽位和CPU的内存通道数。但有了CXL之后,你就可以通过PCIe接口挂载一个大容量的内存池,系统可以把这部分空间当作内存来直接寻址和使用,而不只是当作慢吞吞的硬盘。铠侠这次要送样的CXL内存模组,就是把他们的闪存芯片配上专门设计的控制器,封装成一根能插在CXL接口上的内存条。这样一来,你既能享受到闪存那种超大容量的优势,又能获得接近DRAM的使用体验。

那么问题来了:闪存的延迟天生就比DRAM高得多,直接拿来当内存用,性能不会崩吗?这就是铠侠这套方案里最核心的技术亮点所在了。根据EE Times Japan的报道,铠侠内存部门下属的内存应用技术负责人松寺克己在简报会上公布了一组模拟测试数据,相当有意思。他说,如果把系统中三分之一的DRAM替换成CXL内存模组,整套系统的性能损失居然控制在不到5%的范围之内。换句话说,你牺牲了一丁点儿的性能,却换来了大幅度的容量提升和成本下降。这还没完,松寺克己进一步指出,如果在不增加总成本的前提下,把一部分DRAM换成CXL内存模组,系统的总内存容量可以直接翻倍,同时性能还能提升1.3倍。这个账算下来就很有诱惑力了——同样的钱,容量翻番,速度反而更快,这不就是传说中的既要又要还要吗?

为什么能做到这一点呢?关键就在于实际工作中的内存访问模式并不是均匀分布的。松寺克己在简报会上提到了一个80/20法则:大约80%的内存访问操作,其实只集中在20%的热点数据上;剩下的80%的数据,被访问的频率要低得多。传统的DRAM方案是不管三七二十一,所有数据都放在昂贵的高速内存里,等于花了大价钱去伺候那些一年到头也见不了几次面的冷数据。而铠侠的做法是,把那80%的冷数据挪到闪存上去,用CXL协议让CPU可以直接访问它们,同时把那20%的热数据继续留在DRAM里享受最高速的待遇。这样一来,既解决了容量瓶颈,又没有显著拖累整体性能,相当于给服务器内存做了一个精细化的分级管理。

当然,闪存本身的延迟问题确实是个绕不开的坎儿。为了解决这个难题,铠侠专门研发了一颗配套的控制器芯片,里面集成了各种降低延迟的硬件特性。再配合上他们自家的XL-FLASH高速闪存颗粒,最终做出来的CXL内存模组,按照EE Times Japan的说法,跟传统方案相比延迟降低了超过90%。这个数字听起来挺唬人的,但你仔细琢磨一下就会发现,它比的“传统方案”应该是指纯闪存方案或者普通NVMe SSD走PCIe的那种延迟,而不是跟DRAM比。即便如此,能把闪存的延迟压缩到这个量级,已经是非常了不起的工程成就了。

除了CXL内存模组这块,铠侠在简报会上还更新了他们旗舰级BiCS FLASH的产品路线图。根据EE Times Japan的记录,铠侠已经在今年7月份的时候,于岩手县北上工厂开始了第10代BiCS FLASH 3D闪存的大规模量产,同时还向客户送出了1Tb容量TLC颗粒的样品。注意,这里的1Tb指的是Terabit,也就是128GB的单颗Die容量。跟第8代产品相比,第10代BiCS FLASH在存储密度上提升了59%,读取能效提升了40%,写入能效提升了30%。这几个数字摆在一起,说明铠侠在3D NAND堆叠工艺上确实没有停下脚步,每一代的进步都相当扎实。

不过,真正让业内同行和资本市场高度关注的,可能还不是CXL内存模组本身,而是铠侠跟NVIDIA之间围绕CMX架构展开的合作。CMX这三个字母在这里代表的是Context Memory Storage,也就是上下文记忆存储,这是NVIDIA在今年3月份对外公布的一种全新存储层级架构。CMX的核心载体是NVIDIA的BlueField-4数据处理单元,也就是DPU。这个架构的设计初衷,是为了给GPU扩展出一块专门用于存放长上下文对话信息和智能体推理数据的存储空间。大家都知道,现在的AI推理场景越来越复杂,尤其是那种需要记住很长对话历史的聊天机器人,或者是能够自主规划执行任务的Agent型AI,它们对内存的需求几乎是无限的。传统的做法是把这些上下文数据放在GPU的显存里,但显存就那么几十GB,很快就撑爆了。CMX的思路就是把这些数据卸到一块专门的、由NVMe SSD组成的存储池里,通过BlueField-4 DPU来管理和调度,让GPU能够按需快速调取,从而突破显存容量的限制。

铠侠在这个架构里扮演的角色,就是SSD供应商。今年7月份,铠侠发布了CM10系列企业级SSD,这款产品搭载的就是第10代BiCS FLASH TLC闪存颗粒,而且是专门针对NVIDIA CMX架构做了适配和优化的。更重要的是,CM10系列是铠侠旗下第一款支持PCIe 6.0接口的企业级SSD。PCIe 6.0的带宽是PCIe 5.0的两倍,理论上可以提供更高的数据传输速率,这对于CMX这种需要频繁在GPU和存储池之间交换数据的场景来说至关重要。另外,报道中还提到,CM10系列还支持直接冷板液冷散热。这一点对于下一代AI基础设施的部署来说非常实用,因为随着功耗密度的不断提升,传统的风冷方案已经越来越捉襟见肘,直接冷板液冷能够在更小的空间内带走更多的热量,给数据中心节省大量的冷却能耗。

关于铠侠和NVIDIA的合作关系,铠侠SSD业务部门下属技术规划部的总经理滨田诚在接受采访时说了几句挺有意思的话。他表示,考虑到这个市场的巨大潜力,竞争肯定是不可避免的,但铠侠目前跟NVIDIA的合作依然非常紧密,双方的高层保持着定期的沟通。滨田诚的原话是:“我并不觉得我们落后了。”他还透露,铠侠也在密切关注AI PC和物理AI领域涌现出来的新型存储需求。所谓物理AI,指的就是那些能够感知物理世界并与之交互的AI系统,比如自动驾驶汽车、工业机器人、人形机器人等等。这些设备对存储的需求跟云端服务器完全不同,更强调低功耗、高耐久度和紧凑的尺寸,这恰恰是铠侠这类闪存厂商擅长的领域。

既然提到了竞争,那就不得不说说三星。根据韩国媒体SeDaily的报道,三星也在加速扩张其V9 NAND的产能,其中一个重要的驱动力就是NVIDIA即将在下半年正式推出的CMX架构。SeDaily披露了一些相当惊人的数字:单个CMX存储池可以容纳576块SSD,总容量高达9600TB。而整个CMX架构对NAND闪存的总需求量,预计将从今年的3500万TB猛增到明年的超过1亿TB。这是什么概念?相当于一年之内需求量翻了将近三倍。三星今年的NAND闪存总产出预计在2.5亿TB左右,也就是说,光是CMX这一个架构,明年就要吃掉三星全年产能的四成以上。面对这么大的一块蛋糕,三星显然是想凭借自己庞大的产能优势,在CMX市场上抢下更大的份额。

综合来看,铠侠这次的动作释放了几个清晰的信号。第一,CXL技术在内存扩展领域的商业化落地正在加速,不再只是实验室里的概念验证,而是真的要有产品送样了。第二,NVIDIA的CMX架构正在快速构建自己的生态链,铠侠、三星这些存储巨头都在积极卡位,谁都不想错过下一波AI基础设施升级的红利。第三,闪存和内存之间的边界正在变得模糊,未来服务器的内存架构很可能不再是单纯的DRAM一统天下,而是DRAM、CXL内存、NVMe SSD三级分层的混合体系。对于咱们这些普通用户来说,短期内的直接影响可能还没那么明显,但如果你是一家正在规划明年服务器采购预算的公司,或者是一个正在为大模型推理成本头疼的创业者,那么铠侠这套CXL内存模组的进展,绝对值得你持续跟踪。毕竟,省下来的每一分钱,那可都是实实在在的利润。

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

x
发表于 4 小时前 | 显示全部楼层
游客请登录后查看回复内容
回复 支持 反对

使用道具 举报

 楼主| 发表于 3 小时前 | 显示全部楼层
游客请登录后查看回复内容
回复 支持 反对

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

APP|手机版|小黑屋|关于我们|联系我们|法律条款|数码之家-技术知识分享平台

闽公网安备35020502000485号

闽ICP备2021002735号-2

GMT+8, 2026-9-9 14:21 , Processed in 0.078000 second(s), 5 queries , Gzip On, Redis On.

Powered by Discuz!

© MyDigit.Net Since 2006

快速回复 返回顶部 返回列表