|
|
爱科技、爱创意、爱折腾、爱极致,我们都是技术控
您需要 登录 才可以下载或查看,没有账号?立即注册
x
本帖最后由 纯今 于 2026-9-4 10:02 编辑
对全球电脑垃圾佬们来说,这不是什么好消息
9月初的行业峰会上,谷歌供应链基础设施高级总监 Nikhil Cheriant,亲口确认了三件事。
一是谷歌在拆退役服务器,回收还能用的元器件。 二是还在进口退役服务器,专门拆 DDR4 内存。 三是谷歌自己设计制造把ddr4内存插回新 Al 服务器的转接卡。
毕竟,DDR4是1.2V,DDR5是1.1V,二者都是288针。
今后,大船来的内存,不是少了,而是根本就没有了,甚至,谷歌从全球进口,可以说:船头变了,船的行驶方向变了
我猜谷歌肯定已经暗地里执行的差不多了,才肯在会议上发布新闻
谷歌回收 DDR4 内存 + 自研转接卡的完整原因分析
一、最大核心背景:AI 已经内存受限(Memory‑Bound),而不是算力受限,这是范式的转变
Nikhil Cherian 的核心论断:早期大模型瓶颈是 GPU/TPU 算力不够;现在瓶颈变成内存容量不足。MoE 混合专家模型、多模态大模型、AI Agent,会疯狂吃掉系统内存、KV 缓存。一台 AI 服务器,高性能内存已经占到整机硬件成本 75%。昂贵的 TPU、GPU 芯片,如果没有足够内存,就只能闲置等待数据,数十亿算力投资直接被浪费。
HBM 高带宽内存专供芯片高速缓存,系统侧大容量内存(DDR4/DDR5)依然缺口巨大。DDR5 服务器内存现在供货紧张、涨价,产能跟不上云厂商疯狂扩张 AI 集群的速度。
二、为什么偏偏回收 DDR4,而不是直接买新 DDR5?- 供货缺口优先于速度参数DDR5 带宽更高,但现在买不到足够多、足够大容量的服务器内存条。谷歌缺的首先是GB 容量,而不是 DDR5 那点带宽提升。对于AI 推理业务(TPU‑8i 这类推理集群),并不一定非要 DDR5 的高带宽,更大内存池放 KV 缓存才是刚需,DDR4 完全够用。
- 海量现成存量,成本极低谷歌过去十几年海量传统服务器退役,里面大量 32G/64G DDR4 ECC 内存寿命剩余很长,完全健康。拆旧内存≈几乎零成本获得大容量 DRAM;采购全新 DDR5 是天价,还抢不到货。甚至不惜进口外面的退役服务器,只为抠上面 DDR4 内存条,本质是 “抢 DRAM 颗粒”。
- 降供应链风险,建立内部循环库存不再 100% 依赖三星、海力士、美光的 DRAM 供货,自建一条内部内存回收供应链,对冲厂商产能、涨价风险。
三、为什么必须自己做转接卡(适配器)?新一代 AI 服务器主板、Arm Axion CPU、TPU 配套主板原生插槽只支持 DDR5,物理插槽、信号标准不一样:
DDR4、DDR5 金手指插槽物理不兼容,插不进去;
电压不同:DDR4=1.2V,DDR5=1.1V;
内存控制器信号协议不一样,不能直接通信。
这块谷歌自研转接卡的作用:
- 物理转接:DDR4 内存插在转接卡,转接卡再插到主板 DDR5 插槽;
- 电平、信号转换:翻译 DDR5 内存控制器信号,让老 DDR4 模组可以被新主板识别读写;
- 时序、稳定性调校:谷歌做固件补偿,保证旧内存在全新 AI 平台长时间 7×24 小时稳定运行。
四、使用场景(DDR4 不会拿来跑大模型训练)回收 DDR4 + 转接卡,主要用于推理服务器集群(TPU 8i),不是超大模型训练。训练任务仍然使用 HBM、高速 DDR5;推理更吃内存容量、对带宽敏感度更低,DDR4 复用性价比最高。
五、配套的另一半策略(软硬件双管齐下)硬件回收旧 DDR4 扩容内存池;软件同步做优化:KV 缓存压缩、模型稀疏优化,从源头降低内存消耗,两条路线一起对抗「内存墙」。
AI 算力芯片已经够用,但大容量 DRAM 内存严重缺货涨价;谷歌挖退役服务器库存的 DDR4 内存补容量缺口;因为新主板只支持 DDR5 插槽,于是自研转接卡解决物理、信号不兼容问题,把旧内存 “救活” 装到新一代 AI 推理服务器上。
对全球电脑垃圾佬们来说,这不是什么好消息
|
|