最近一段时间,内存价格的持续上涨牵动着每个人的心,不仅我们普通消费者在吐槽开学三件套都买不起了,连财大气粗的各大互联网大厂也深陷内存涨价的困扰,甚至有媒体曝出,知名大厂谷歌都被这天价内存逼成了垃圾佬,开始去拆解旧服务器内存来救急了,我们到底该怎么看呢?
天价内存把大厂都逼成了垃圾佬
据快科技的报道,DRAM供应持续紧张,已将AI巨头逼到拆旧服务器回收内存的地步。
谷歌供应链基础设施高级总监Nikhil Cherian近日透露,AI行业已从算力受限快速转向内存受限,高性能内存目前占单台AI服务器物料成本的约75%。
据Cherian介绍,为突破内存瓶颈,谷歌在软硬件两端同时发力,硬件层面甚至建立了内部回收供应链,将退役服务器拆解后回收可用的DDR4内存模块。
Cherian坦言,谷歌专门设计了硬件转接器,使上一代DDR4内存能够连接到新一代AI服务器上,并且正在专门重新导入退役服务器以拆取其中的DDR4模组。
软件层面,谷歌持续优化底层函数库、模型架构和KV Cache压缩技术,试图降低单位算力的内存消耗。
今年谷歌推出了两款TPU ASIC,分别是面向训练的TPU8t和面向推理的TPU8i,其中TPU8i每颗芯片配备288GB HBM3e,提供8.6 TB/s内存带宽,并集成384MB片上SRAM用于存储活跃的KV缓存,减少对外部系统内存的查询需求。
TPU8i服务器采用谷歌自研基于Arm架构的Axion处理器替代传统x86主机CPU,依赖高速DDR5内存架构处理数据预处理等主机级任务。
为啥连谷歌都要拆旧服务器内存来用了?
谷歌当垃圾佬这事乍一听挺魔幻,连谷歌这种万亿市值的科技巨头,居然也开始干起“捡破烂”的活儿,拆解退役服务器的内存条。很多人第一反应是:是不是谷歌没钱了?或者是在搞公关噱头?
首先,AI产业的竞争重心已经从算力过渡到了内存。过去很长一段时间,行业讨论AI产业瓶颈,大家嘴里念叨的永远都是GPU,所有人都把目光盯在显卡芯片上面,默认只要拿到足够多的高性能GPU,大模型的算力问题就可以迎刃而解。可现实产业跑下来大家才慢慢醒悟过来,GPU再强,如果内存跟不上,大量的模型权重、上下文数据就没办法存放,强悍的算力根本发挥不出该有的价值。大模型越做越大,上下文窗口越拉越长,每一次推理、每一轮训练,都要吃掉巨量的内存空间,内存不再是服务器里面一个无关紧要的配角,直接变成了约束AI业务扩张的核心短板,也正是如此现在木桶效应的短板已经从之前的显卡芯片转移到了更为现实的存储芯片。
对于谷歌这种体量的企业来说,它要跑通海量模型,搭建遍布全球的算力集群,内存不是锦上添花的选配,是实打实的刚需。买全新服务器内存的代价已经高到让人难以接受,内存已经占到AI服务器物料成本当中极高的比重,继续大规模采购全新内存,会直接吃掉云计算业务大量的利润空间。退役服务器里面的DDR4内存,硬件本身并没有彻底失效,只是老一代服务器整机到达服役周期,被迫下线淘汰。熟悉计算机硬件的朋友都知道,除非是产品彻底更新换代无法使用了,一根内存条的使用寿命往往很长,笔者2013年读研的时候买的神舟笔记本虽然用的还是老旧的DDR3L内存,但是如今依然可以使用,如果不是因为笔记本屏幕实在老化了,这台笔记本依然有着相当不错的表现。