AI inference 走向全栈协调:GPU 之外,存储和网络的仗怎么打

我最大的一个感受是:GPU 这一轮的故事讲到头了。不是说 GPU 不重要,而是当 inference 真正进生产的时候,瓶颈不在 GPU 上,在它周围那一圈东西上

原文是 SiliconANGLE / theCUBE 在 Supermicro Open Storage Summit 上的一段三人圆桌。坐着的三位:Super Micro 的 William Li、IBM 的 Ka Wai Leung、Kioxia 的 Anders Graham,主持人是 theCUBE 的 Rob Strechay。聊的事说大不大,说小不小——AI inference 这件事,真正决定 token 成本和速度的,不是 GPU 本身,而是存储延迟、网络带宽、数据搬移、功耗这一整套东西。

这句话是 IBM 的 Leung 说的,翻译过来就是:

你需要先搞清自己跑的是哪种工作负载。根据工作负载,你才能理解它的特征,然后才能在它后面搭系统。这才是 scaling 的真正做法。”

一句话。Leung 的潜台词是:很多人买 GPU 的时候不看工作负载,直接冲最贵的那款,然后发现 inference 不赚钱——因为后面的存储、网络、电力全没跟上。

一、先看工作负载,再看后面的硬件

Kioxia 的 Graham 上来就把”training 跟 inference 用的存储完全不是一回事”这个事讲清楚了。

Training 阶段,你需要的是高顺序吞吐——把数据流式地喂进 GPU,让 GPU 一直有活干,同时把 checkpoint 写出去。这一段对延迟没那么敏感,带宽够就行。

Inference 阶段反过来。最要紧的是低延迟随机读写。你想想,每次用户问问题,模型都要去查一堆上下文——RAG(retrieval-augmented generation,检索增强生成)里要拉私有数据、要拉最近更新的内容,这个查询是高频、小数据量、随机分布的。延迟一旦高了,token 出来的速度就垮了。

Graham 自己的话:

我觉得现在就是 inference 的元年……低延迟是关键。我们也看到 RAG——基本上就是在飞行中用新数据或私有数据给模型补上下文,不管是什么数据,只要 retrain 模型需要的就要能拉得到。”

那数据从哪来?Leung 接了一句很现实的话:

第一个挑战是……企业账户,他们的数据散得到处都是。你作为一个组织或者架构师,怎么在不把这些海量数据全塞进 AI factory 的前提下,把所有这些类型的数据都接上?Data gravity——data sovereignty——是一个大考量。”

翻译过来:企业最难的从来不是模型,是数据躺在 mainframe 里、躺在 ERP 里、躺在 S3 里、躺在对象存储里,你想让 inference 流水线接到所有这些数据,但你又不想全搬进 GPU 那边的 HBM。这就是为什么 Kioxia、IBM 存储、Supermicro 这种”基础设施层”的人在 AI 圆桌上有位置——因为 GPU 是明星,但数据在别处。

二、全栈设计把效率顶上去

功耗是数据中心真正的紧箍咒——不是没钱买 GPU,是没电、没地方散热

Graham 给了 Kioxia CM9(基于 BiCS8 NAND)和上一代 CM7 的对比数据:

看 random workload 的话……random read 提升了 76%,random write 提升超过 100%。

这是按每瓦 IOPS 算的。换句话说,同样一块盘,新一代做同样的事,电费减半多。这个数字值得记一下,因为 AI inference 跑起来盘读写是持续的,不是 burst。

硬件省电是一回事,真到 inference 流水线里,更需要的是全栈协调——这也是 Summit 名字里”Open Storage”的含义。Supermicro 的 William Li 把他们做的 reference design 摆出来:Nvidia HGX B300 做计算 + IBM Storage Scale Erasure Code Edition 做存储 + Kioxia 做盘。这套架构的核心是分层存储——高频访问的放高速层,冷的放容量层。

Li 的话值得直接引:

Storage 在数据中心整体方案里扮演着最核心的角色;我们叫它 Data Center Building Block Solutions。你不用去不同厂商那里找服务器机柜集成、液冷部署、存储部署;你可以……直接找 Supermicro,跟所有活跃的合作伙伴一起,包括 IBM 和 Kioxia,一起拿到其他软件方案。”

说白了——Supermicro 想把自己从”机柜厂”升级成”端到端方案的集成商”,GPU 是 Nvidia 的,盘是 Kioxia 的,存储软件是 IBM 的,Supermicro 做的是把这三样焊在一起交付。这种集成在 inference 这种”每个环节都卡”的工作负载上,确实比单独买零件有优势。

最后这段最有意思——Nvidia + IBM + Supermicro 一起测了一个东西:把 IBM Storage Scale 当成 KV cache 的共享层。KV cache 是什么?每次跟 LLM 对话,模型要把历史 token 缓存下来,免得每次都重新算。这个缓存默认是放在 GPU 的 HBM 里,但 HBM 又贵又小。所以业界一直在想:能不能把 KV cache 挪出来,放到更便宜的存储上,这次就是测这个。

结果:sub-second(亚秒级)拿到第一个 token,在所有测试的 prompt 长度上。然后他们把 Spectrum-X 网络加上”重负载”做对抗测试——Nvidia 团队要求塞一堆网络噪声进去,模拟真实世界。Leung 的原话:

数字掉了一点,但从 4.8 requests per second 掉到 3.6 左右,所以从 22 倍效率变成了 18 倍。即便我们往网络里塞了一堆噪声去模拟真实条件。”

翻译过来:没有网络噪声时,共享 KV cache 让 inference 效率达到 uncached baseline 的 22 倍;塞了噪声之后,还是 18 倍。这个数字,18× 的底线,就是真实生产环境下能拿到的提升。

这个数字为什么重要?因为它说明一件事——KV cache 共享不是一个实验室的 hack,是一个扛得住网络压力的生产化方案。Kioxia 的盘 + IBM 的存储软件 + Supermicro 的集成 + Nvidia 的网络,这四个东西被一条 inference 流水线串起来,跑出来的 18× 是可以拿去跟客户讲的故事。


我看完整个圆桌,真正在讲的事不是”AI 推理变难了”,而是“AI 推理从来就不是 GPU 一家的事,只是以前模型卡得明显,现在模型跑顺了,瓶颈就外移到存储、网络、电力这层基础设施”。如果你在企业里管 AI 基础设施,别只算 GPU 的钱,把存储 IOPS/W、网络带宽、KV cache 复用率、机柜功耗这些一起算,才能得出真实的 token 单价。Kioxia 的 76%/100% 提升是真的,IBM Storage Scale 共享 KV cache 的 18× 提升也是真的——但这些数字单独看没有意义,要拼成一条流水线看。Supermicro 这种传统”机柜厂”正在变成”集成商”,Nvidia 这种”GPU 厂”正在变成”网络厂”,IBM 这种”存储软件厂”正在变成”AI 数据底座”,三家拼出来的 reference design 可能是接下来一年 inference 生产化部署的标准范式。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值